adapted to new gliederung

This commit is contained in:
Simon
2024-01-06 13:27:33 +01:00
parent d65b2a4ce4
commit 0e0f90539c
25 changed files with 133 additions and 53 deletions
+18
View File
@@ -0,0 +1,18 @@
\section{Annahmen}
\label{sec:annahmen}
% Preprocessing
Um die Texterkennung mittels Tesseract zu verbessern, ist es sinnvoll, die mögliche Vielfalt an Preprocessing-Ausgangsdaten durch Annahmen zu beschränken.
Im Falle dieser Bachelorarbeit handelt es sich bei den zu verarbeitenden Bildern ausschließlich um digitale Bildschirmaufnahmen von grafischen Benutzeroberflächen. Es kann also angenommen werden, dass die Screenshots keine Transparenz aufweisen, die Perspektive der Aufnahme nicht verzerrt ist und der Kontrast in den meisten Fällen ausreicht, um die relevanten Inhalte zu erkennen. Weiters beinhalten grafische Oberflächen oft farbige Hintergrundflächen zur Trennung von Sektionen, auf die bei etwaigem Thresholding geachtet werden muss. Nach Sichtung des zu verarbeitenden Bilddatensatzes fällt zudem auf, dass die betroffenen Inhalte durch das Selektieren mit der Maus oft sehr eng abgeschnitten wurden.
% TODO
Beispiel Screenshots
% Postprocessing
Da ... Screenshots, ... ist davon auszugehen, dass auch fremdsymbole... Außerdem: Sprachanpassung (RegEx filter)
% TODO
Postprocessing, NLP Folien