added postprocessing filter comparison

This commit is contained in:
Simon
2024-01-11 00:18:11 +01:00
parent b1f482ed79
commit 253495d405
21 changed files with 2021 additions and 34 deletions
+3 -5
View File
@@ -54,21 +54,19 @@ Für die Verwendung von Tesseract ist es wichtig, unabhängig von der Diversitä
Bei der Texterkennung kommt es manchmal vor, dass grafische Elemente als Unicode-Symbole erkannt werden. Beispielsweise finden sich in den ungefilterten Ergebnisdaten oft Aufzählungszeichen "•" oder diverse Varianten von Bindestrichen "". Diese Zeichen sind gemäß Anwendungsanforderungen nicht relevant für die Schlagwortsuche und können somit entfernt \bzw ignoriert werden.
\begin{figure}[ht]
\begin{figure}[t]
\centering
\begin{minipage}{0.45\textwidth}
\includegraphics[width=0.90\textwidth]{include/postprocessing/source.png}
\end{minipage}
\hfill
\begin{minipage}{0.5\textwidth}
\lstinputlisting[numbers=none]{include/postprocessing/source.json}
\lstinputlisting[firstnumber=100,linerange={100-110}]{include/postprocessing/source.json}
\end{minipage}
\caption{Ungefilterte Liste von Ergebnisdaten bei Durchführung der Texterkennung in dem gezeigten Screenshot.}
\caption{Auszug aus den ungefilterten Ergebnisdaten bei Durchführung der Texterkennung in dem gezeigten Screenshot.}
\label{fig:screenshot_postprocessing}
\end{figure}
\subsubsection*{Mehrsprachigkeit}
\label{annahmen_mehrsprachigkeit}