Show simple item record

Odhalování úniku dat v nevyvážených datových sadách s využitím populárních postupů ve strojovém učení
dc.contributor.advisorČervinka, Michal
dc.creatorJůzová, Anna
dc.date.accessioned2026-07-29T12:34:32Z
dc.date.available2026-07-29T12:34:32Z
dc.date.issued2026
dc.identifier.urihttp://hdl.handle.net/20.500.11956/210733
dc.description.abstractThe increasing use of machine learning for prediction and classification tasks has led to numerous reports of strong model performance across a wide range of domains. Nevertheless, when data leakage occurs, in which training data contains information unavailable in real-world settings, such results may not be fully reliable, as indicated by recent research. This study examines the ef- fects of data leakage in highly imbalanced binary classification problems. Using more than thirty datasets with substantially varying sizes and models for su- pervised learning and novelty detection, we evaluate several common sources of data leakage across the full machine learning pipeline. The results indicate that oversampling-related leakage can severely distort reported performance, despite its presence in some applied studies including published payment fraud detection research. While the effects of the remaining examined leakage types appear marginal or even negligible on average, exceptions depending on the dataset, model, and the modelling process specification may arise, leading to more inflated performance estimates. JEL Classification C45, C52, G17 Keywords data leakage, machine learning, class imbalance, payment fraud detection Title Uncovering Data Leakage in Imbalanced Datasets with Popular Machine...en_US
dc.description.abstractRostoucí využití strojového učení pro predikční a klasifikační úlohy vedlo k mno- ha zprávám o vysoké výkonnosti modelů napříš různými doménami. Nicméně v případech, kdy dochází k úniku dat, kdy trénovací data obsahují informace, které by v reálném nasazení nebyly dostupné, nemusí být tyto výsledky plně spolehlivé, jak ukazuje nedávný výzkum. Tato studie zkoumá dopady úniků dat v úlohách binární klasifikace s výrazně nevyváženými daty. Pomocí více než třiceti datasetů výrazně odlišných velikostí a za použití modelů pro super- vizované učení i detekci anomálií je hodnoceno několik běžných zdrojů úniku dat v celém modelovacím procesu. Výsledky ukazují, že únik spojený s přev- zorkováním může výrazně zkreslit reportovanou výkonnost, a to i přes jeho výskyt v některých aplikačních studiích včetně výzkumu detekce platebních podvodů. Ačkoli vliv zbývajících zkoumaných typů úniků se v průměru jeví jako marginální nebo dokonce zcela zanedbatelný, vyskytují se výjimky závislé na datasetu, modelu a nastavení procesu modelování, které mohou vést k většímu nadhodnocení výkonnosti. Klasifikace JEL C45, C52, G17 Klíčová slova únik dat, strojové učení, nevyvážená data, detekce podvodných plateb Název práce Odhalování úniku dat v nevyvážených da- tových sadách s využitím populárních pos- tupů ve strojovém učenícs_CZ
dc.languageEnglishcs_CZ
dc.language.isoen_US
dc.publisherUniverzita Karlova, Fakulta sociálních vědcs_CZ
dc.subjectdata leakageen_US
dc.subjectmachine learningen_US
dc.subjectclass imbalanceen_US
dc.subjectpayment fraud detectionen_US
dc.subjectúnik datcs_CZ
dc.subjectstrojové učenícs_CZ
dc.subjectnevyvážená datacs_CZ
dc.subjectdetekce podvodných platebcs_CZ
dc.titleUncovering Data Leakage in Imbalanced Datasets with Popular Machine Learning Pipelinesen_US
dc.typediplomová prácecs_CZ
dcterms.created2026
dcterms.dateAccepted2026-06-17
dc.description.departmentInstitut ekonomických studiícs_CZ
dc.description.departmentInstitute of Economic Studiesen_US
dc.description.facultyFakulta sociálních vědcs_CZ
dc.description.facultyFaculty of Social Sciencesen_US
dc.identifier.repId283076
dc.title.translatedOdhalování úniku dat v nevyvážených datových sadách s využitím populárních postupů ve strojovém učenícs_CZ
dc.contributor.refereeHanus, Luboš
thesis.degree.nameMgr.
thesis.degree.levelnavazující magisterskécs_CZ
thesis.degree.disciplineEconomics and Finance with specialisation in Financial Markets and Data Analysisen_US
thesis.degree.disciplineEkonomie a finance se specializací Finanční trhy a datová analýzacs_CZ
thesis.degree.programEkonomie a financecs_CZ
thesis.degree.programEconomics and Financeen_US
uk.thesis.typediplomová prácecs_CZ
uk.taxonomy.organization-csFakulta sociálních věd::Institut ekonomických studiícs_CZ
uk.taxonomy.organization-enFaculty of Social Sciences::Institute of Economic Studiesen_US
uk.faculty-name.csFakulta sociálních vědcs_CZ
uk.faculty-name.enFaculty of Social Sciencesen_US
uk.faculty-abbr.csFSVcs_CZ
uk.degree-discipline.csEkonomie a finance se specializací Finanční trhy a datová analýzacs_CZ
uk.degree-discipline.enEconomics and Finance with specialisation in Financial Markets and Data Analysisen_US
uk.degree-program.csEkonomie a financecs_CZ
uk.degree-program.enEconomics and Financeen_US
thesis.grade.csVýborněcs_CZ
thesis.grade.enExcellenten_US
uk.abstract.csRostoucí využití strojového učení pro predikční a klasifikační úlohy vedlo k mno- ha zprávám o vysoké výkonnosti modelů napříš různými doménami. Nicméně v případech, kdy dochází k úniku dat, kdy trénovací data obsahují informace, které by v reálném nasazení nebyly dostupné, nemusí být tyto výsledky plně spolehlivé, jak ukazuje nedávný výzkum. Tato studie zkoumá dopady úniků dat v úlohách binární klasifikace s výrazně nevyváženými daty. Pomocí více než třiceti datasetů výrazně odlišných velikostí a za použití modelů pro super- vizované učení i detekci anomálií je hodnoceno několik běžných zdrojů úniku dat v celém modelovacím procesu. Výsledky ukazují, že únik spojený s přev- zorkováním může výrazně zkreslit reportovanou výkonnost, a to i přes jeho výskyt v některých aplikačních studiích včetně výzkumu detekce platebních podvodů. Ačkoli vliv zbývajících zkoumaných typů úniků se v průměru jeví jako marginální nebo dokonce zcela zanedbatelný, vyskytují se výjimky závislé na datasetu, modelu a nastavení procesu modelování, které mohou vést k většímu nadhodnocení výkonnosti. Klasifikace JEL C45, C52, G17 Klíčová slova únik dat, strojové učení, nevyvážená data, detekce podvodných plateb Název práce Odhalování úniku dat v nevyvážených da- tových sadách s využitím populárních pos- tupů ve strojovém učenícs_CZ
uk.abstract.enThe increasing use of machine learning for prediction and classification tasks has led to numerous reports of strong model performance across a wide range of domains. Nevertheless, when data leakage occurs, in which training data contains information unavailable in real-world settings, such results may not be fully reliable, as indicated by recent research. This study examines the ef- fects of data leakage in highly imbalanced binary classification problems. Using more than thirty datasets with substantially varying sizes and models for su- pervised learning and novelty detection, we evaluate several common sources of data leakage across the full machine learning pipeline. The results indicate that oversampling-related leakage can severely distort reported performance, despite its presence in some applied studies including published payment fraud detection research. While the effects of the remaining examined leakage types appear marginal or even negligible on average, exceptions depending on the dataset, model, and the modelling process specification may arise, leading to more inflated performance estimates. JEL Classification C45, C52, G17 Keywords data leakage, machine learning, class imbalance, payment fraud detection Title Uncovering Data Leakage in Imbalanced Datasets with Popular Machine...en_US
uk.file-availabilityV
uk.grantorUniverzita Karlova, Fakulta sociálních věd, Institut ekonomických studiícs_CZ
thesis.grade.codeA
uk.publication-placePrahacs_CZ
uk.thesis.defenceStatusO


Files in this item

Thumbnail
Thumbnail
Thumbnail
Thumbnail
Thumbnail
Thumbnail
Thumbnail

This item appears in the following Collection(s)

Show simple item record


© 2025 Univerzita Karlova, Ústřední knihovna, Ovocný trh 560/5, 116 36 Praha 1; email: admin-repozitar [at] cuni.cz

Za dodržení všech ustanovení autorského zákona jsou zodpovědné jednotlivé složky Univerzity Karlovy. / Each constituent part of Charles University is responsible for adherence to all provisions of the copyright law.

Upozornění / Notice: Získané informace nemohou být použity k výdělečným účelům nebo vydávány za studijní, vědeckou nebo jinou tvůrčí činnost jiné osoby než autora. / Any retrieved information shall not be used for any commercial purposes or claimed as results of studying, scientific or any other creative activities of any person other than the author.

DSpace software copyright © 2002-2015  DuraSpace
Theme by 
@mire NV