Tesseract OCR blijft de meest gebruikte open source optische tekenherkenningsmotor voor het extraheren van tekst uit afbeeldingen of gescande documenten. De installatie op Windows lijkt oppervlakkig eenvoudig, maar verschillende technische details – omgevingsvariabele, versiekeuze, beveiliging van taalmodellen – bepalen de goede werking van de software en de betrouwbaarheid van de resultaten.
Kwetsbaarheid CVE-2026-73067: waarom de versie van Tesseract voorop staat
Voordat je zelfs maar een installer start, is de eerste controle de versie van het binaire bestand. Sinds augustus 2026 zijn Tesseract-versies ouder dan 5.5.3 getroffen door de kwetsbaarheid CVE-2026-73067, een defect van het type heap out-of-bounds read dat wordt geactiveerd bij het laden van een kwaadaardig .traineddata-bestand via TessBaseAPI::Init.
In de praktijk kan een beschadigd taalmodel een crash van het proces veroorzaken voordat zelfs maar de minste afbeelding wordt verwerkt. Op een geïsoleerde werkplek lijkt het risico beperkt. Op een productie-server of een CI/CD-pijplijn die binnenkomende documenten verwerkt, wordt het aanvalsvlak reëel.
De oplossing is eenvoudig: installeer Tesseract in versie 5.5.3 of hoger. Als je al een oudere versie hebt, bevestigt de opdracht tesseract --version in een terminal het exacte nummer. Elke versie onder dit nummer rechtvaardigt een onmiddellijke update. Een gedetailleerde tutorial laat je Tesseract OCR op Windows installeren door elke stap te volgen vanaf het downloaden van de juiste uitvoerbare bestand.
Download de Tesseract OCR-installateur voor Windows 64 bits
De Windows-binaries van Tesseract worden onderhouden door de Universiteit van Mannheim (UB Mannheim) en gedistribueerd via hun GitHub-repository. Twee formaten worden aangeboden: een 64-bits installer en een 32-bits installer. Bijna alle huidige Windows-machines draaien op 64 bits, dus het is het bestand tesseract-ocr-w64-setup dat je moet ophalen.

Eenmaal gedownload, start de installatie-assistent in een paar klikken. Het scherm voor de taalselectie betreft de interface van de installer, niet de herkenningstalen. Dit punt creëert regelmatig verwarring bij gebruikers die denken dat ze het Frans al in dit stadium configureren.
Selectie van componenten en taalmodellen
De bepalende stap van de installer is de selectie van componenten. Standaard is alleen het Engelse taalmodel (eng.traineddata) aangevinkt. Om tekst in het Frans te herkennen, moet je de boomstructuur van aanvullende talen uitvouwen en expliciet het Franse taalpakket (fra.traineddata) aanvinken.
Elk taalmodel voegt enkele megabytes toe. Het is niet nodig om alles aan te vinken: selecteer alleen de talen die je nodig hebt. Een tessdata-map die vol staat met ongebruikte modellen vertraagt de initiële laadtijd en vergroot het blootstellingsrisico aan de eerder genoemde kwetsbaarheid.
Kies de installatiemap
De installer biedt een standaard pad, meestal C:Program FilesTesseract-OCR. Dit pad is in de meeste gevallen geschikt. Het wijzigen van deze map is op zich geen probleem, maar je moet het nieuwe pad exact in de omgevingsvariabele PATH rapporteren, wat een veelvoorkomende bron van fouten is.
Configureer de PATH- en TESSDATA_PREFIX-variabele op Windows
De installatie van het binaire bestand is niet genoeg. Om ervoor te zorgen dat de opdracht tesseract vanuit elke terminal (PowerShell, cmd, geïntegreerde terminal van VS Code) wordt herkend, moet de installatiemap in de omgevingsvariabele PATH staan.
De procedure gaat via de geavanceerde systeeminstellingen van Windows:
- Open het Startmenu, zoek naar “omgevingsvariabelen” en klik op “Systeemomgevingsvariabelen bewerken”
- In het tabblad “Geavanceerd”, klik op “Omgevingsvariabelen”, en selecteer vervolgens de variabele
Pathin de gebruikers- of systeemsectie - Voeg een nieuwe invoer toe met het volledige pad van de Tesseract-map, bijvoorbeeld
C:Program FilesTesseract-OCR - Maak een variabele
TESSDATA_PREFIXaan die naar de submaptessdatawijst (bijvoorbeeldC:Program FilesTesseract-OCRtessdata) zodat Tesseract zijn taalmodellen kan vinden
Na wijziging moeten alle reeds geopende terminals worden gesloten en opnieuw geopend om de nieuwe variabelen in aanmerking te nemen. Dit is een klassieke vergetelheid die leidt tot foutmeldingen zoals 'tesseract' is niet erkend als een interne of externe opdracht.

Beveilig de tessdata-map na installatie
De kwetsbaarheid CVE-2026-73067 maakt deze stap minder onbeduidend dan het lijkt. De veiligheidsaanbevelingen die rond deze kwetsbaarheid zijn gepubliceerd, benadrukken verschillende concrete maatregelen:
- Beperk de bronnen van .traineddata-modellen tot vertrouwde repositories, bij voorkeur de officiële repositories van het Tesseract-project op GitHub
- Beperk de machtigingen van de
tessdata-map tot alleen-lezen voor serviceaccounts, met eigendom gereserveerd voor het beheerdersaccount - Controleer de integriteit van gedownloade modelbestanden via SHA-256-hashes voordat je ze in de map plaatst
Op een persoonlijke ontwikkelwerkplek zijn deze voorzorgsmaatregelen goede praktijken. Op een machine die blootstaat aan ongecontroleerde binnenkomende bestanden (scanningserver, documentverwerkingspijplijn), worden ze een operationele noodzaak.
Controleer de installatie van Tesseract OCR via de opdrachtregel
Eenmaal de PATH geconfigureerd en de terminal opnieuw opgestart, houdt de controle in twee opdrachten. De eerste, tesseract --version, moet een versie nummer teruggeven dat gelijk is aan of hoger is dan 5.5.3. De tweede, tesseract --list-langs, toont de daadwerkelijk beschikbare talen in de tessdata-map.
Als de versieopdracht werkt maar --list-langs niets teruggeeft of alleen eng, komt het probleem ofwel van een taalmodel dat niet is aangevinkt tijdens de installatie, of van een verkeerd geconfigureerde TESSDATA_PREFIX-variabele. Deze twee punten concentreren de meeste problemen die door gebruikers op technische forums worden gerapporteerd.
Voor een eerste test van de herkenning genereert een opdracht zoals tesseract image.png output -l fra een bestand output.txt met de geëxtraheerde tekst. De kwaliteit van het resultaat hangt sterk af van de resolutie van de bronafbeelding en het contrast tussen de tekst en de achtergrond. Afbeeldingen onder de 300 DPI produceren regelmatig verzwakte resultaten, zonder dat de OCR-motor de schuld is.
De installatie van Tesseract OCR op Windows omvat uiteindelijk vier stappen: download de juiste 64-bits installer, selecteer de geschikte taalmodellen, configureer de omgevingsvariabelen en vergrendel vervolgens de machtigingen van de tessdata-map. Versie 5.5.3 markeert een veiligheidsdrempel die niet genegeerd mag worden, en de controle via de opdrachtregel blijft de enige betrouwbare manier om te bevestigen dat alles werkt.



