Vytěžování textu z fotografií
Optical Character Recognition at Camera Captured Images
diploma thesis (DEFENDED)
View/ Open
Permanent link
http://hdl.handle.net/20.500.11956/65883Identifiers
Study Information System: 127959
Collections
- Kvalifikační práce [11211]
Author
Advisor
Referee
Kolomazník, Jan
Faculty / Institute
Faculty of Mathematics and Physics
Discipline
Software Systems
Department
Department of Software Engineering
Date of defense
26. 5. 2014
Publisher
Univerzita Karlova, Matematicko-fyzikální fakultaLanguage
Czech
Grade
Very good
Keywords (Czech)
OCR, fotky, rozpoznání znaků, segmentace, normalizaceKeywords (English)
OCR, photos, character recognition, segmentation, normalizationPředstavujeme postup řešení jednotlivých kroků potřebných k binarizaci a segmentaci řádků textu obsažených ve fotografiích stránek tištěného textu. Uvádíme způsob normalizace neuniformního osvětlení fotografie. Navrhujeme algoritmus pro binarizaci vstupní bitmapy založený na dvou- dimenzionálním pravděpodobnostním modelu pixelu, který bere v úvahu i jeho okolí. Pokračujeme popisem robustního detektoru orientace řádků textu založeného na optimalizaci účelové funkce vycházející z prvních derivací obrazové funkce. Nakonec se zabýváme detekcí jednotlivých řádků textu a jejich následnou segmentací. Tvary výsledných řádků textu na závěr optimalizujeme pomocí grafového algoritmu. Powered by TCPDF (www.tcpdf.org)
We present solution of steps necessary for binarization and text lines detection contained in printed documents digitized by the camera. We introduce a normalization of non-uniform illumination method for text photographs. We propose input bitmap binarization algorithm based on two-dimensional probability pixel model which also considers its surrounding. We continue with description of robust text lines orientation detector based on optimization of risk function using first order derivatives of image function. In the end we present text lines detection and segmentation algorithm. Final shape of segmented lines is optimized with usage of graph algorithm. Powered by TCPDF (www.tcpdf.org)