Klasifikace žánrů pomocí strojového učení
dc.contributor.advisorNeruda, Roman
dc.creatorBílek, Jan
dc.description.abstractIn this thesis, we compare the bag of words approach with doc2vec doc- ument embeddings on the task of classification of book genres. We cre- ate 3 datasets with different text lengths by extracting short snippets from books in Project Gutenberg repository. Each dataset comprises of more than 200000 documents and 14 different genres. For 3200-character documents, we achieve F1-score of 0.862 when stacking models trained on both bag of words and doc2vec representations. We also explore the relationships be- tween documents, genres and words using similarity metrics on their vector representations and report typical words for each genre. As part of the thesis, we also present an online webapp for book genre classification. 1en_US
dc.description.abstractV této práci porovnáváme bag of words a doc2vec přístup k problému klasifikace literárních žánrů. Na základě textů knih z repozitáře Projektu Gutenberg vytváříme tři datatsety různých délek. Každý z nich obsahuje přes 200000 dokumentů a 14 různých žánrů. Na souboru dokumentů s délkou 3200 znaků dosahujeme kombinací modelů bag of words a doc2vec reprezentace F1-skóre 0.862. V práci dále zkoumáme vztahy mezi knihami, žánry a slovy na základě podobnostní jejich vektorové reprezentace a uvádíme typická slova pro každý žánr. Součástí práce je webová aplikace na klasifikaci žánrů. 1cs_CZ
dc.publisherUniverzita Karlova, Matematicko-fyzikální fakultacs_CZ
dc.subjectMachine learningen_US
dc.subjectnatural language processingen_US
dc.subjectgenre classificationen_US
dc.subjectword embeddingsen_US
dc.subjectparagraph vectoren_US
dc.subjectStrojové učenícs_CZ
dc.subjectzpracování přirozeného jazykacs_CZ
dc.subjectklasifikace žánrůcs_CZ
dc.subjectvnoření slovcs_CZ
dc.subjectparagraph vectorcs_CZ
dc.titleGenres classification by means of machine learningen_US
dc.typediplomová prácecs_CZ
dc.description.departmentKatedra teoretické informatiky a matematické logikycs_CZ
dc.description.departmentDepartment of Theoretical Computer Science and Mathematical Logicen_US
dc.description.facultyFaculty of Mathematics and Physicsen_US
dc.description.facultyMatematicko-fyzikální fakultacs_CZ
dc.title.translatedKlasifikace žánrů pomocí strojového učenícs_CZ
dc.contributor.refereeVomlelová, Marta
thesis.degree.levelnavazující magisterskécs_CZ
thesis.degree.disciplineArtificial Intelligenceen_US
thesis.degree.disciplineUmělá inteligencecs_CZ
thesis.degree.programComputer Scienceen_US
uk.thesis.typediplomová prácecs_CZ
uk.taxonomy.organization-csMatematicko-fyzikální fakulta::Katedra teoretické informatiky a matematické logikycs_CZ
uk.taxonomy.organization-enFaculty of Mathematics and Physics::Department of Theoretical Computer Science and Mathematical Logicen_US
uk.faculty-name.csMatematicko-fyzikální fakultacs_CZ
uk.faculty-name.enFaculty of Mathematics and Physicsen_US
uk.degree-discipline.csUmělá inteligencecs_CZ
uk.degree-discipline.enArtificial Intelligenceen_US
uk.degree-program.enComputer Scienceen_US
uk.grantorUniverzita Karlova, Matematicko-fyzikální fakulta, Katedra teoretické informatiky a matematické logikycs_CZ

