more words written
This commit is contained in:
@@ -4,6 +4,7 @@
|
||||
Um die Texterkennung mittels Tesseract und die anschließende Filterung der Ergebnisdaten zu verbessern, ist es sinnvoll, Anwendungsspezifische Annahmen für den Verarbeitungsablauf festzulegen.
|
||||
|
||||
\subsection*{Preprocessing}
|
||||
\label{annahmen_preprocessing}
|
||||
|
||||
\subsubsection*{Eigenschaften von Screenshots}
|
||||
\label{annahmen_bild_eigenschaften}
|
||||
@@ -15,13 +16,14 @@ Im Falle dieser Bachelorarbeit handelt es sich bei den zu verarbeitenden Bildern
|
||||
\subsubsection*{Optimieren von Daten für Tesseract}
|
||||
\label{annahmen_bild_optimal}
|
||||
|
||||
Für die Verwendung von Tesseract ist es wichtig, unabhängig von der Diversität der Ausgangsdaten möglichst einheitliche Bilder zu generieren, die den Trainingsdaten des neuronalen Netzes ähnlich sehen \cite{todo}. Während störende Elemente wie Bildrauschen aus dem Bild entfernt werden sollen, sollen Texte unabhängig von der Hinter- bzw. Vordergrundfarbe gut zu erkennen und leicht von Formen oder grafischen Symbolen abzugrenzen sein.
|
||||
Für die Verwendung von Tesseract ist es wichtig, unabhängig von der Diversität der Ausgangsdaten möglichst einheitliche Bilder zu generieren, die den Trainingsdaten des neuronalen Netzes ähnlich sehen \mcite{todo}. Während störende Elemente wie Bildrauschen aus dem Bild entfernt werden sollen, sollen Texte unabhängig von der Hinter- bzw. Vordergrundfarbe gut zu erkennen und leicht von Formen oder grafischen Symbolen abzugrenzen sein.
|
||||
|
||||
% TODO Textbeschreibung, welche Eigenschaften die Eingangsdaten am besten haben sollten
|
||||
|
||||
% TODO Beispielbilder: So sollen die Daten optimalerweise aussehen
|
||||
|
||||
\subsection*{Postprocessing}
|
||||
\label{annahmen_postprocessing}
|
||||
|
||||
\subsubsection*{Filtern von Symbolen}
|
||||
|
||||
@@ -30,12 +32,14 @@ Bei der Texterkennung kommt es manchmal vor, dass grafische Elemente als Unicode
|
||||
% TODO Zeigen ungefilterter Ergebnisdaten
|
||||
|
||||
\subsubsection*{Mehrsprachigkeit}
|
||||
\label{annahmen_mehrsprachigkeit}
|
||||
|
||||
Eine weitere Anforderung an das Textverarbeitungssystem ist außerdem das Einlesen und Interpretieren mehrsprachiger Bilddateien. So sollen beispielsweise Bilder mit englischen, deutschen oder italienischen Inhalten zugeführt und die Ergebnisdaten richtig verarbeitet werden können. Um eine Filterung für verschiedene Zeichensätze zu ermöglichen und eine Unterstützung für Sprachen mit nicht-lateinischen Schriften zu gewährleisten, werden dynamische Sprachfilter verwendet, die individuell an die jeweilige Sprache angepasst werden können. Um die Ergebnisdaten nicht unnötig aufzubauschen, werden für die initialen Tests und die Beschreibung der generellen Vorgehensweise im Rahmen dieser Bachelorarbeit werden jedoch nur deutsche oder englische Inhalte verarbeitet.
|
||||
|
||||
% TODO Postprocessing, NLP Folien
|
||||
|
||||
\subsubsection*{Schlagworte}
|
||||
\label{annahmen_schlagworte}
|
||||
|
||||
Für die spätere Suche von Screenshots sollen relevante Schlagworte aus den erkannten Textdaten extrahiert werden. Ein Wort eignet sich dann als Schlagwort, wenn es in relevantem Bezug zum jeweiligen Bild steht und dabei idealerweise eine wichtige Aktion oder Information widerspiegelt. Inhalte, die direkt in der grafischen Benutzeroberfläche ersichtlich sind, eignen sich demnach besonders gut als Suchworte. Damit die Menge an Schlagwörtern allerdings nicht zu unspezifisch wird, sollte es vermieden werden, allgemeine sogenannte Stoppwörter (\engl{Stop words}) ohne besondere Semantik, wie "und", "oder", in das Ergebnis mit aufzunehmen. Sie beinhalten keine spezifische Information und fördern aufgrund ihrer Häufigkeit das Auftreten von Verwechslungen.
|
||||
|
||||
|
||||
Reference in New Issue
Block a user