Zeichen-Whitelist der Texterkennung um Kleinbuchstaben erweitert

tessedit_char_whitelist ließ bisher nur Großbuchstaben, Ziffern und wenige
Sonderzeichen zu. Der Nutzer will den vollständigen Etikettentext sehen, nicht
nur die von der App verstandenen Felder - die Whitelist deckt deshalb jetzt
Groß- und Kleinbuchstaben, Ziffern sowie die auf Etiketten üblichen Satz- und
Sonderzeichen ab. Das kann die Genauigkeit bei den Codeteilen (Kapazität,
Rank, Geschwindigkeit, Teilenummer) etwas verringern - eine bewusst in Kauf
genommene Abwägung, siehe Kommentar an Ort und Stelle.
This commit is contained in:
2026-07-29 15:18:56 +02:00
parent 54b1447f21
commit 1c10c68053
+13 -2
View File
@@ -117,8 +117,19 @@ function getWorker() {
workerPromise = createWorker('eng')
.then(async (worker) => {
await worker.setParameters({
// Etiketten enthalten nur Grossbuchstaben, Ziffern und wenige Sonderzeichen.
tessedit_char_whitelist: 'ABCDEFGHIJKLMNOPQRSTUVWXYZ0123456789-/. x',
// Der Nutzer will den vollstaendigen Etikettentext sehen, nicht nur
// die von der App verstandenen Felder (die ohnehin nur Grossbuch-
// staben, Ziffern und wenige Zeichen brauchen) - deshalb Gross- UND
// Kleinbuchstaben, Ziffern sowie die auf Etiketten ueblichen Satz-
// und Sonderzeichen. Das kann die Genauigkeit bei den Codeteilen
// (Kapazitaet, Rank, Geschwindigkeit, Teilenummer) etwas verringern,
// weil Tesseract nun z.B. zwischen "O" und "o" unterscheiden muss -
// hingenommen, weil extractFields() ohnehin verwechslungstolerant
// gegen die bekannten Werte prueft (siehe spec.js/CONFUSIONS) und
// der Nutzer diesen Tausch ausdruecklich will.
tessedit_char_whitelist:
'ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyz0123456789'
+ ' -/.,:;()+*_#%&',
});
return worker;
})