Page image classification for content-specific data processing
Klasifikace obrazu stránek pro zpracování dat specifických pro obsah
diplomová práce (OBHÁJENO)
Zobrazit/ otevřít
Trvalý odkaz
http://hdl.handle.net/20.500.11956/209473Identifikátory
SIS: 283932
Kolekce
- Kvalifikační práce [12373]
Autor
Vedoucí práce
Konzultant práce
Pecina, Pavel
Oponent práce
Hajič, Jan
Fakulta / součást
Matematicko-fyzikální fakulta
Obor
Computer Science - Language Technologies and Computational Linguistics
Katedra / ústav / klinika
Ústav formální a aplikované lingvistiky
Datum obhajoby
4. 6. 2026
Nakladatel
Univerzita Karlova, Matematicko-fyzikální fakultaJazyk
Angličtina
Známka
Výborně
Klíčová slova (česky)
klasifikace obrazů|zpracování digitalizovaných archivůKlíčová slova (anglicky)
image classification|processing of digitised archivesDigitalizační projekty v humanitních vědách, konkrétně v oblasti archeologie, často generují obrovské množství nasnímaných stran z historických dokumentů, což představuje značnou výzvu pro manuální třídění a analýzu. Hlavním cílem tohoto projektu je řešit tuto potřebu vývojem a vyhodnocením automatizovaného systému pro klasifikaci obrazů, který je navržen tak, aby kategorizoval strany historických dokumentů na základě jejich obsahu, a tím umožnil na míru přizpůsobené navazující analytické postupy. Tyto archivy obsahují různorodý obsah, včetně různých typů textu (rukopisný, strojopisný, tištěný), grafických prvků (kresby, mapy, fotografie) a rozvržení (prostý text, tabulky, formuláře). Díky využití pokroků v architekturách neuronových sítí tento systém usnadňuje pracovní postupy specifické pro daný obsah, jako je oddělení stran vyžadujících optické rozpoznávání znaků (OCR) od těch, které potřebují grafickou analýzu. Výsledné modely, datové sady a software jsou uvolněny pod open-source licencemi na podporu širší komunity v oblasti digitálních humanitních věd.
