Zpracování scanovaných dokumentů
Post-processing of scanned documents
bachelor thesis (NOT DEFENDED)
View/ Open
Permanent link
http://hdl.handle.net/20.500.11956/61914Identifiers
Study Information System: 117545
Collections
- Kvalifikační práce [11242]
Author
Advisor
Referee
Böhm, Martin
Faculty / Institute
Faculty of Mathematics and Physics
Discipline
Programming
Department
Department of Applied Mathematics
Date of defense
15. 6. 2015
Publisher
Univerzita Karlova, Matematicko-fyzikální fakultaLanguage
Czech
Grade
Fail
Keywords (Czech)
post-processing, zpracování obrazu, segmentace obrazu, clusterováníKeywords (English)
post-processing, image processing, image segmentation, clusteringPředmětem této práce je navrhnout zpracování skenovaných dokumentů obsahujících textové a netextové elementy. V této práci je tento problém analyzován a rozdělen na menší podproblémy, které jsou dále řešeny. Hlavní řešené problémy jsou předzpracování obrázku, při kterém se mají potlačit nedostatky skenování, například špatný kontrast či našikmo sejmutý obraz, dále je řešena segmentace dokumentu na znaky, linky a obrázky a závěrem komprese výstupu pomocí clusterování znaků. Dále je cílem této práce navržené řešení implementovat formou programu, který naskenovaný dokument zpracuje a vytvoří PDF dokument skládající se z nalezených komponent. Powered by TCPDF (www.tcpdf.org)
The subject of this work is to propose a method for post-processing of scanned documents containing text and non-text elements. In this work, this problem is analyzed and divided into smaller sub- problems, which are solved. Main problems we propose solutions to are pre-processing of an input image to suppress scanning defects such as poor contrast or rotation of an input image, segmentation to characters, lines and images and finally compression of output document by clustering text elements. We will implement this proposed method as a program processing scanned images into PDF document. Powered by TCPDF (www.tcpdf.org)