adapted to new gliederung
This commit is contained in:
@@ -0,0 +1,18 @@
|
||||
\section{Annahmen}
|
||||
\label{sec:annahmen}
|
||||
|
||||
% Preprocessing
|
||||
|
||||
Um die Texterkennung mittels Tesseract zu verbessern, ist es sinnvoll, die mögliche Vielfalt an Preprocessing-Ausgangsdaten durch Annahmen zu beschränken.
|
||||
|
||||
Im Falle dieser Bachelorarbeit handelt es sich bei den zu verarbeitenden Bildern ausschließlich um digitale Bildschirmaufnahmen von grafischen Benutzeroberflächen. Es kann also angenommen werden, dass die Screenshots keine Transparenz aufweisen, die Perspektive der Aufnahme nicht verzerrt ist und der Kontrast in den meisten Fällen ausreicht, um die relevanten Inhalte zu erkennen. Weiters beinhalten grafische Oberflächen oft farbige Hintergrundflächen zur Trennung von Sektionen, auf die bei etwaigem Thresholding geachtet werden muss. Nach Sichtung des zu verarbeitenden Bilddatensatzes fällt zudem auf, dass die betroffenen Inhalte durch das Selektieren mit der Maus oft sehr eng abgeschnitten wurden.
|
||||
|
||||
% TODO
|
||||
Beispiel Screenshots
|
||||
|
||||
% Postprocessing
|
||||
|
||||
Da ... Screenshots, ... ist davon auszugehen, dass auch fremdsymbole... Außerdem: Sprachanpassung (RegEx filter)
|
||||
|
||||
% TODO
|
||||
Postprocessing, NLP Folien
|
||||
Reference in New Issue
Block a user