analysis++

This commit is contained in:
Simon
2024-01-14 20:53:56 +01:00
parent f7952aca24
commit ad49d65727
3 changed files with 34 additions and 4 deletions
+32 -4
View File
@@ -1,11 +1,39 @@
\section{Analyse}
\label{analyse}
Nachdem, wie in \autoref{implementierung} beschrieben, die vorbereiteten Bilddaten an das Texterkennungssystem übergeben und die Ergebnisse ermittelt wurden, werden die extrahierten Textdaten nun mit den manuell erstellten "Soll-Daten" verglichen. Basierend auf Metriken wie der Levenshtein-Distanz wird eine Statistik ermittelt, anhand derer festgestellt werden kann, welche Vorgehensweise zu der besten Ergebnisqualität führt. Um die Ergebnisse zu visualisieren, erstellt der in \autoref{components_reportgenerator} beschriebene "ReportGenerator" automatisch einen Bericht mit den Vergleichsdaten in Tabellenform.
Nachdem die vorbereiteten Bilddaten an das Text\-erken\-nungs\-system gemäß \autoref{implementierung} übergeben und die Ergebnisse ermittelt wurden, werden die extrahierten Textdaten nun mit den manuell erstellten "Soll-Daten" verglichen. Anhand der Statistik kann festgestellt werden, welche Vorgehens\-weise zu der besten Qualität führt. Um die Ergebnisse zu visualisieren, erstellt der in \autoref{components_reportgenerator} beschriebene "Report\-Generator" auf Basis der Bild\-dateinamen automatisch einen Bericht mit den Vergleichs\-daten in Tabellenform. Für eine bessere Lesbarkeit wird der erstellte Bericht in verschiedene Kategorien unterteilt.
Für eine bessere Lesbarkeit wird der erstellte Bericht in verschiedene Kategorien unterteilt:
\subsection*{Processing-Summary}
\label{report_processingsummary}
Die Kategorie "Processing Summary" beinhaltet eine vereinfachte Übersicht aller Ergebnisse. Je nach Rubrik wird jeweils der Median \bzw Durchschnitt der \hyperref[metriken_cer]{Character Error Rate} und \hyperref[metriken_wer]{Word Error Rate} berechnet.
\begin{table}[!ht]
\centering
\input{include/figures/fig_WER_1}
\caption{Auszug aus der Processing Summary Tabelle im generierten Bericht: Auflistung der Verfahren mit den durchschnittlich besten und schlechtesten Ergebnissen auf Basis der Word Error Rate. Die jeweilige Verarbeitungsmethode ist in der Spalte "Processor" zu finden, die Wortfehlerrate und die Standardabweichung in "Time" und "Deviation".}
\label{tbl:report_summary_wer}
\end{table}
\begin{table}[!ht]
\centering
\input{include/figures/fig_CER_1}
\caption{Auszug aus der Processing Summary Tabelle im generierten Bericht: Auflistung der Verfahren mit den durchschnittlich besten und schlechtesten Ergebnissen auf Basis der Character Error Rate. Die jeweilige Verarbeitungsmethode ist in der Spalte "Processor" zu finden, die Zeichenfehlerrate und die Standardabweichung in "Time" und "Deviation".}
\label{tbl:report_summary_cer}
\end{table}
\begin{table}[!ht]
\centering
\input{include/figures/fig_Time_1}
\caption{Auszug aus der Processing Summary Tabelle im generierten Bericht: Auflistung der Verfahren mit den durchschnittlich besten und schlechtesten Ergebnissen auf Basis der Laufzeit. Die jeweilige Verarbeitungsmethode ist in der Spalte "Processor" zu finden, die Laufzeit und die Standardabweichung in "Time" und "Deviation".}
\label{tbl:report_summary_time}
\end{table}
Auf Basis der Daten in \autoref{tbl:report_summary_wer}, \autoref{tbl:report_summary_cer} und \autoref{tbl:report_summary_time} lässt sich der Gesamterfolg der Bildvorbereitung \bzw der darauf folgenden Filterung feststellen.
Während die Fehlerquoten der Texterkennung mit Vorbereitung der Daten die Fehlerquoten von Texterkennung ohne Vorbereitung unterbieten, ist das Ergebnis unzufriedenstellend. Selbst bei Verwendung des fixen Thresholdingverfahrens mit einem Schwellenwert von 40 \%, werden durchschnittlich Ergebnisse mit einer Wortfehlerrate von ca. 46 \% \bzw 1,5 falsch erkannten Zeichen pro Wort erreicht. Die relativ hohe Standardabweichung von 26 \% lässt auf eine hohe Streuung der Ergebnisdaten, also unregelmäßig gute Erfolge schließen.
\subsection*{Top-Liste} % TODO change title
\label{report_bestof}
\subsection*{Detailvergleich}
\label{report_detailed}