Tesseract OCR bleibt die am häufigsten verwendete Open-Source-Optische-Zeichenerkennung (OCR)-Engine zum Extrahieren von Text aus Bildern oder gescannten Dokumenten. Die Installation unter Windows scheint auf den ersten Blick einfach zu sein, aber mehrere technische Details – Umgebungsvariablen, Versionswahl, Absicherung der Sprachmodelle – beeinflussen die ordnungsgemäße Funktion der Software und die Zuverlässigkeit der Ergebnisse.
Sicherheitsanfälligkeit CVE-2026-73067: Warum die Version von Tesseract entscheidend ist
Bevor Sie einen Installer starten, ist die erste Überprüfung die Version der Binärdatei. Seit August 2026 sind Tesseract-Versionen vor 5.5.3 von der Sicherheitsanfälligkeit CVE-2026-73067 betroffen, einem Heap-Fehler, der beim Laden einer schädlichen .traineddata-Datei über TessBaseAPI::Init ausgelöst wird.
In der Praxis kann ein beschädigtes Sprachmodell einen Absturz des Prozesses verursachen, bevor überhaupt ein Bild verarbeitet wird. Auf einem isolierten Arbeitsplatz scheint das Risiko begrenzt zu sein. Auf einem Produktionsserver oder einer CI/CD-Pipeline, die eingehende Dokumente verarbeitet, wird die Angriffsfläche jedoch real.
Der Fix ist einfach: Installieren Sie Tesseract in Version 5.5.3 oder höher. Wenn Sie bereits eine ältere Version haben, bestätigt der Befehl tesseract --version in einem Terminal die genaue Nummer. Jede niedrigere Version rechtfertigt ein sofortiges Update. Ein detailliertes Tutorial zeigt, wie man Tesseract OCR unter Windows installiert, indem man jeden Schritt vom Herunterladen der richtigen ausführbaren Datei befolgt.
Laden Sie den Tesseract OCR Installer für Windows 64 Bit herunter
Die Windows-Binärdateien von Tesseract werden von der Universität Mannheim (UB Mannheim) gepflegt und über ihr GitHub-Repository verteilt. Es werden zwei Formate angeboten: ein 64-Bit-Installer und ein 32-Bit-Installer. Die überwiegende Mehrheit der aktuellen Windows-Maschinen arbeitet in 64 Bit, daher ist die Datei tesseract-ocr-w64-setup die, die Sie herunterladen sollten.

Sobald die .exe-Datei heruntergeladen ist, startet der Installationsassistent in wenigen Klicks. Der Bildschirm zur Sprachauswahl betrifft die Benutzeroberfläche des Installers, nicht die Erkennungssprachen. Dieser Punkt sorgt regelmäßig für Verwirrung bei Benutzern, die denken, dass sie Französisch bereits in diesem Schritt konfigurieren.
Auswahl der Komponenten und Sprachmodelle
Der entscheidende Schritt des Installers ist die Auswahl der Komponenten. Standardmäßig ist nur das englische Sprachmodell (eng.traineddata) angekreuzt. Um Text auf Französisch zu erkennen, müssen Sie den Baum der zusätzlichen Sprachen aufklappen und ausdrücklich das französische Sprachpaket (fra.traineddata) ankreuzen.
Jedes Sprachmodell fügt einige Megabyte hinzu. Es ist nicht notwendig, alles anzukreuzen: Wählen Sie nur die Sprachen aus, die Sie benötigen. Ein überladener tessdata-Ordner mit ungenutzten Modellen verlangsamt das anfängliche Laden und erweitert die Angriffsfläche für die oben genannte Sicherheitsanfälligkeit.
Auswahl des Installationsverzeichnisses
Der Installer schlägt einen Standardpfad vor, normalerweise C:Program FilesTesseract-OCR. Dieser Pfad ist in den meisten Fällen geeignet. Das Ändern dieses Verzeichnisses ist an sich kein Problem, aber der neue Pfad muss genau in die Umgebungsvariable PATH eingetragen werden, was eine häufige Fehlerquelle ist.
Konfigurieren der PATH- und TESSDATA_PREFIX-Variablen unter Windows
Die Installation der Binärdatei allein reicht nicht aus. Damit der Befehl tesseract von jedem Terminal (PowerShell, cmd, integriertes Terminal von VS Code) erkannt wird, muss das Installationsverzeichnis in der Umgebungsvariable PATH aufgeführt sein.
Das Verfahren erfolgt über die erweiterten Systemeinstellungen von Windows:
- Öffnen Sie das Startmenü, suchen Sie nach “Umgebungsvariablen” und klicken Sie auf “Umgebungsvariablen für das System ändern”
- Im Tab “Erweitert” klicken Sie auf “Umgebungsvariablen” und wählen Sie dann die Variable
Pathim Benutzer- oder Systembereich aus - Fügen Sie einen neuen Eintrag mit dem vollständigen Pfad des Tesseract-Verzeichnisses hinzu, z. B.
C:Program FilesTesseract-OCR - Erstellen Sie eine Variable
TESSDATA_PREFIX, die auf das Unterverzeichnistessdataverweist (z. B.C:Program FilesTesseract-OCRtessdata), damit Tesseract seine Sprachmodelle findet
Nach der Änderung müssen alle bereits geöffneten Terminals geschlossen und neu geöffnet werden, um die neuen Variablen zu berücksichtigen. Dies ist ein klassisches Versäumnis, das zu Fehlermeldungen wie 'tesseract' wird nicht als interner oder externer Befehl erkannt führt.

Den tessdata-Ordner nach der Installation absichern
Die Sicherheitsanfälligkeit CVE-2026-73067 macht diesen Schritt weniger nebensächlich, als er scheint. Die Sicherheitsempfehlungen, die zu diesem Fehler veröffentlicht wurden, betonen mehrere konkrete Maßnahmen:
- Die Quellen für .traineddata-Modelle auf vertrauenswürdige Repositories beschränken, idealerweise auf die offiziellen Repositories des Tesseract-Projekts auf GitHub
- Die Berechtigungen des
tessdata-Verzeichnisses auf schreibgeschützt für Dienstkonten beschränken, mit Eigentum, das dem Administratorkonto vorbehalten ist - Die Integrität der heruntergeladenen Modell-Dateien über SHA-256-Prüfziffern überprüfen, bevor sie im Verzeichnis abgelegt werden
Auf einem persönlichen Entwicklungsrechner sind diese Vorsichtsmaßnahmen gute Praxis. Auf einem Computer, der unkontrollierte eingehende Dateien erhält (Scannerserver, Dokumentenverarbeitungspipeline), werden sie zur operationalen Notwendigkeit.
Überprüfen der Installation von Tesseract OCR über die Befehlszeile
Sobald der PATH konfiguriert und das Terminal neu gestartet wurde, besteht die Überprüfung aus zwei Befehlen. Der erste, tesseract --version, sollte eine Versionsnummer zurückgeben, die gleich oder höher als 5.5.3 ist. Der zweite, tesseract --list-langs, zeigt die tatsächlich im tessdata-Verzeichnis verfügbaren Sprachen an.
Wenn der Versionsbefehl funktioniert, aber --list-langs nichts oder nur eng zurückgibt, liegt das Problem entweder an einem nicht angekreuzten Sprachmodell während der Installation oder an einer falsch konfigurierten TESSDATA_PREFIX-Variable. Diese beiden Punkte konzentrieren die Mehrheit der von Benutzern in technischen Foren gemeldeten Probleme.
Für einen ersten Erkennungstest erzeugt ein Befehl wie tesseract image.png output -l fra eine Datei output.txt, die den extrahierten Text enthält. Die Qualität des Ergebnisses hängt stark von der Auflösung des Quellbildes und dem Kontrast zwischen Text und Hintergrund ab. Bilder unter 300 DPI liefern regelmäßig degradierte Ergebnisse, ohne dass die OCR-Engine dafür verantwortlich ist.
Die Installation von Tesseract OCR unter Windows umfasst letztendlich vier Schritte: den richtigen 64-Bit-Installer herunterladen, die passenden Sprachmodelle auswählen, die Umgebungsvariablen konfigurieren und dann die Berechtigungen des tessdata-Verzeichnisses sperren. Die Version 5.5.3 stellt einen Sicherheitsstandard dar, den man nicht ignorieren sollte, und die Überprüfung über die Befehlszeile bleibt das einzige zuverlässige Mittel, um zu bestätigen, dass alles funktioniert.



