| dc.contributor.advisor | Červinka, Michal | |
| dc.creator | Jůzová, Anna | |
| dc.date.accessioned | 2026-07-29T12:34:32Z | |
| dc.date.available | 2026-07-29T12:34:32Z | |
| dc.date.issued | 2026 | |
| dc.identifier.uri | http://hdl.handle.net/20.500.11956/210733 | |
| dc.description.abstract | The increasing use of machine learning for prediction and classification tasks has led to numerous reports of strong model performance across a wide range of domains. Nevertheless, when data leakage occurs, in which training data contains information unavailable in real-world settings, such results may not be fully reliable, as indicated by recent research. This study examines the ef- fects of data leakage in highly imbalanced binary classification problems. Using more than thirty datasets with substantially varying sizes and models for su- pervised learning and novelty detection, we evaluate several common sources of data leakage across the full machine learning pipeline. The results indicate that oversampling-related leakage can severely distort reported performance, despite its presence in some applied studies including published payment fraud detection research. While the effects of the remaining examined leakage types appear marginal or even negligible on average, exceptions depending on the dataset, model, and the modelling process specification may arise, leading to more inflated performance estimates. JEL Classification C45, C52, G17 Keywords data leakage, machine learning, class imbalance, payment fraud detection Title Uncovering Data Leakage in Imbalanced Datasets with Popular Machine... | en_US |
| dc.description.abstract | Rostoucí využití strojového učení pro predikční a klasifikační úlohy vedlo k mno- ha zprávám o vysoké výkonnosti modelů napříš různými doménami. Nicméně v případech, kdy dochází k úniku dat, kdy trénovací data obsahují informace, které by v reálném nasazení nebyly dostupné, nemusí být tyto výsledky plně spolehlivé, jak ukazuje nedávný výzkum. Tato studie zkoumá dopady úniků dat v úlohách binární klasifikace s výrazně nevyváženými daty. Pomocí více než třiceti datasetů výrazně odlišných velikostí a za použití modelů pro super- vizované učení i detekci anomálií je hodnoceno několik běžných zdrojů úniku dat v celém modelovacím procesu. Výsledky ukazují, že únik spojený s přev- zorkováním může výrazně zkreslit reportovanou výkonnost, a to i přes jeho výskyt v některých aplikačních studiích včetně výzkumu detekce platebních podvodů. Ačkoli vliv zbývajících zkoumaných typů úniků se v průměru jeví jako marginální nebo dokonce zcela zanedbatelný, vyskytují se výjimky závislé na datasetu, modelu a nastavení procesu modelování, které mohou vést k většímu nadhodnocení výkonnosti. Klasifikace JEL C45, C52, G17 Klíčová slova únik dat, strojové učení, nevyvážená data, detekce podvodných plateb Název práce Odhalování úniku dat v nevyvážených da- tových sadách s využitím populárních pos- tupů ve strojovém učení | cs_CZ |
| dc.language | English | cs_CZ |
| dc.language.iso | en_US | |
| dc.publisher | Univerzita Karlova, Fakulta sociálních věd | cs_CZ |
| dc.subject | data leakage | en_US |
| dc.subject | machine learning | en_US |
| dc.subject | class imbalance | en_US |
| dc.subject | payment fraud detection | en_US |
| dc.subject | únik dat | cs_CZ |
| dc.subject | strojové učení | cs_CZ |
| dc.subject | nevyvážená data | cs_CZ |
| dc.subject | detekce podvodných plateb | cs_CZ |
| dc.title | Uncovering Data Leakage in Imbalanced Datasets with Popular Machine Learning Pipelines | en_US |
| dc.type | diplomová práce | cs_CZ |
| dcterms.created | 2026 | |
| dcterms.dateAccepted | 2026-06-17 | |
| dc.description.department | Institut ekonomických studií | cs_CZ |
| dc.description.department | Institute of Economic Studies | en_US |
| dc.description.faculty | Fakulta sociálních věd | cs_CZ |
| dc.description.faculty | Faculty of Social Sciences | en_US |
| dc.identifier.repId | 283076 | |
| dc.title.translated | Odhalování úniku dat v nevyvážených datových sadách s využitím populárních postupů ve strojovém učení | cs_CZ |
| dc.contributor.referee | Hanus, Luboš | |
| thesis.degree.name | Mgr. | |
| thesis.degree.level | navazující magisterské | cs_CZ |
| thesis.degree.discipline | Economics and Finance with specialisation in Financial Markets and Data Analysis | en_US |
| thesis.degree.discipline | Ekonomie a finance se specializací Finanční trhy a datová analýza | cs_CZ |
| thesis.degree.program | Ekonomie a finance | cs_CZ |
| thesis.degree.program | Economics and Finance | en_US |
| uk.thesis.type | diplomová práce | cs_CZ |
| uk.taxonomy.organization-cs | Fakulta sociálních věd::Institut ekonomických studií | cs_CZ |
| uk.taxonomy.organization-en | Faculty of Social Sciences::Institute of Economic Studies | en_US |
| uk.faculty-name.cs | Fakulta sociálních věd | cs_CZ |
| uk.faculty-name.en | Faculty of Social Sciences | en_US |
| uk.faculty-abbr.cs | FSV | cs_CZ |
| uk.degree-discipline.cs | Ekonomie a finance se specializací Finanční trhy a datová analýza | cs_CZ |
| uk.degree-discipline.en | Economics and Finance with specialisation in Financial Markets and Data Analysis | en_US |
| uk.degree-program.cs | Ekonomie a finance | cs_CZ |
| uk.degree-program.en | Economics and Finance | en_US |
| thesis.grade.cs | Výborně | cs_CZ |
| thesis.grade.en | Excellent | en_US |
| uk.abstract.cs | Rostoucí využití strojového učení pro predikční a klasifikační úlohy vedlo k mno- ha zprávám o vysoké výkonnosti modelů napříš různými doménami. Nicméně v případech, kdy dochází k úniku dat, kdy trénovací data obsahují informace, které by v reálném nasazení nebyly dostupné, nemusí být tyto výsledky plně spolehlivé, jak ukazuje nedávný výzkum. Tato studie zkoumá dopady úniků dat v úlohách binární klasifikace s výrazně nevyváženými daty. Pomocí více než třiceti datasetů výrazně odlišných velikostí a za použití modelů pro super- vizované učení i detekci anomálií je hodnoceno několik běžných zdrojů úniku dat v celém modelovacím procesu. Výsledky ukazují, že únik spojený s přev- zorkováním může výrazně zkreslit reportovanou výkonnost, a to i přes jeho výskyt v některých aplikačních studiích včetně výzkumu detekce platebních podvodů. Ačkoli vliv zbývajících zkoumaných typů úniků se v průměru jeví jako marginální nebo dokonce zcela zanedbatelný, vyskytují se výjimky závislé na datasetu, modelu a nastavení procesu modelování, které mohou vést k většímu nadhodnocení výkonnosti. Klasifikace JEL C45, C52, G17 Klíčová slova únik dat, strojové učení, nevyvážená data, detekce podvodných plateb Název práce Odhalování úniku dat v nevyvážených da- tových sadách s využitím populárních pos- tupů ve strojovém učení | cs_CZ |
| uk.abstract.en | The increasing use of machine learning for prediction and classification tasks has led to numerous reports of strong model performance across a wide range of domains. Nevertheless, when data leakage occurs, in which training data contains information unavailable in real-world settings, such results may not be fully reliable, as indicated by recent research. This study examines the ef- fects of data leakage in highly imbalanced binary classification problems. Using more than thirty datasets with substantially varying sizes and models for su- pervised learning and novelty detection, we evaluate several common sources of data leakage across the full machine learning pipeline. The results indicate that oversampling-related leakage can severely distort reported performance, despite its presence in some applied studies including published payment fraud detection research. While the effects of the remaining examined leakage types appear marginal or even negligible on average, exceptions depending on the dataset, model, and the modelling process specification may arise, leading to more inflated performance estimates. JEL Classification C45, C52, G17 Keywords data leakage, machine learning, class imbalance, payment fraud detection Title Uncovering Data Leakage in Imbalanced Datasets with Popular Machine... | en_US |
| uk.file-availability | V | |
| uk.grantor | Univerzita Karlova, Fakulta sociálních věd, Institut ekonomických studií | cs_CZ |
| thesis.grade.code | A | |
| uk.publication-place | Praha | cs_CZ |
| uk.thesis.defenceStatus | O | |