
Tesseract OCR reste le moteur de reconnaissance optique de caractères open source le plus utilisé pour extraire du texte depuis des images ou des documents numérisés. Son installation sur Windows paraît simple en surface, mais plusieurs détails techniques – variable d’environnement, choix de version, sécurisation des modèles de langue – conditionnent le bon fonctionnement du logiciel et la fiabilité des résultats.
Vulnérabilité CVE-2026-73067 : pourquoi la version de Tesseract compte avant tout
Avant même de lancer un installateur, la première vérification concerne la version du binaire. Depuis août 2026, les versions de Tesseract antérieures à 5.5.3 sont affectées par la vulnérabilité CVE-2026-73067, un défaut de type heap out-of-bounds read déclenché lors du chargement d’un fichier .traineddata malicieux via TessBaseAPI::Init.
A lire également : Astuces pratiques pour rallonger le fil de son coupe-bordure facilement et efficacement
En pratique, un modèle de langue corrompu peut provoquer un crash du processus avant même le traitement de la moindre image. Sur un poste de travail isolé, le risque semble limité. Sur un serveur de production ou une chaîne CI/CD qui traite des documents entrants, la surface d’attaque devient réelle.
Le correctif est direct : installer Tesseract en version 5.5.3 ou supérieure. Si vous avez déjà une version plus ancienne, la commande tesseract --version dans un terminal vous confirmera le numéro exact. Toute version inférieure justifie une mise à jour immédiate. Un tutoriel détaillé permet d’installer Tesseract OCR sur Windows en suivant chaque étape depuis le téléchargement du bon exécutable.
Lire également : Guide pratique pour envoyer de l'argent à l'étranger avec Western Union facilement
Télécharger l’installateur Tesseract OCR pour Windows 64 bits
Les binaires Windows de Tesseract sont maintenus par l’université de Mannheim (UB Mannheim) et distribués sur leur dépôt GitHub. Deux formats sont proposés : un installateur 64 bits et un installateur 32 bits. La quasi-totalité des machines Windows actuelles fonctionnent en 64 bits, c’est donc le fichier tesseract-ocr-w64-setup qu’il faut récupérer.

Une fois le fichier .exe téléchargé, l’assistant d’installation se lance en quelques clics. L’écran de sélection de langue concerne l’interface de l’installateur, pas les langues de reconnaissance. Ce point crée régulièrement de la confusion chez les utilisateurs qui pensent configurer le français dès cette étape.
Sélection des composants et des modèles de langue
L’étape déterminante de l’installateur est la sélection des composants. Par défaut, seul le modèle de langue anglais (eng.traineddata) est coché. Pour reconnaître du texte en français, il faut déplier l’arborescence des langues additionnelles et cocher explicitement le pack de langue française (fra.traineddata).
Chaque modèle de langue ajoute quelques mégaoctets. Inutile de tout cocher : sélectionnez uniquement les langues dont vous avez besoin. Un répertoire tessdata surchargé de modèles inutilisés ralentit le chargement initial et élargit la surface d’exposition à la vulnérabilité mentionnée plus haut.
Choix du répertoire d’installation
L’installateur propose un chemin par défaut, généralement C:\Program Files\Tesseract-OCR. Ce chemin convient dans la majorité des cas. Modifier ce répertoire ne pose pas de problème en soi, mais il faudra reporter exactement le nouveau chemin dans la variable d’environnement PATH, ce qui est une source d’erreur fréquente.
Configurer la variable PATH et TESSDATA_PREFIX sur Windows
L’installation du binaire ne suffit pas. Pour que la commande tesseract soit reconnue depuis n’importe quel terminal (PowerShell, cmd, terminal intégré de VS Code), le répertoire d’installation doit figurer dans la variable d’environnement PATH.
La procédure passe par les paramètres système avancés de Windows :
- Ouvrir le menu Démarrer, rechercher « variables d’environnement » et cliquer sur « Modifier les variables d’environnement système »
- Dans l’onglet « Avancé », cliquer sur « Variables d’environnement », puis sélectionner la variable
Pathdans la section utilisateur ou système - Ajouter une nouvelle entrée avec le chemin complet du répertoire Tesseract, par exemple
C:\Program Files\Tesseract-OCR - Créer une variable
TESSDATA_PREFIXpointant vers le sous-répertoiretessdata(par exempleC:\Program Files\Tesseract-OCR\tessdata) pour que Tesseract localise ses modèles de langue
Après modification, tout terminal déjà ouvert doit être fermé et rouvert pour prendre en compte les nouvelles variables. C’est un oubli classique qui conduit à des messages d’erreur du type 'tesseract' n'est pas reconnu en tant que commande interne.

Sécuriser le répertoire tessdata après installation
La vulnérabilité CVE-2026-73067 rend cette étape moins anecdotique qu’elle ne le paraît. Les recommandations de sécurité publiées autour de cette faille insistent sur plusieurs mesures concrètes :
- Limiter les sources de modèles .traineddata à des dépôts de confiance, idéalement les dépôts officiels du projet Tesseract sur GitHub
- Restreindre les permissions du répertoire
tessdataen lecture seule pour les comptes de service, avec propriété réservée au compte administrateur - Vérifier l’intégrité des fichiers de modèles téléchargés via des empreintes SHA-256 avant de les placer dans le répertoire
Sur un poste de développement personnel, ces précautions relèvent de la bonne pratique. Sur une machine exposée à des fichiers entrants non contrôlés (serveur de numérisation, pipeline de traitement documentaire), elles deviennent une nécessité opérationnelle.
Vérifier l’installation de Tesseract OCR en ligne de commande
Une fois le PATH configuré et le terminal relancé, la vérification tient en deux commandes. La première, tesseract --version, doit renvoyer un numéro de version égal ou supérieur à 5.5.3. La seconde, tesseract --list-langs, affiche les langues effectivement disponibles dans le répertoire tessdata.
Si la commande version fonctionne mais que --list-langs ne renvoie rien ou uniquement eng, le problème vient soit d’un modèle de langue non coché lors de l’installation, soit d’une variable TESSDATA_PREFIX mal configurée. Ces deux points concentrent la majorité des problèmes signalés par les utilisateurs sur les forums techniques.
Pour un premier test de reconnaissance, une commande du type tesseract image.png output -l fra génère un fichier output.txt contenant le texte extrait. La qualité du résultat dépend fortement de la résolution de l’image source et du contraste entre le texte et le fond. Des images en dessous de 300 DPI produisent régulièrement des résultats dégradés, sans que le moteur OCR soit en cause.
L’installation de Tesseract OCR sur Windows tient finalement en quatre opérations : télécharger le bon installateur 64 bits, sélectionner les modèles de langue adaptés, configurer les variables d’environnement, puis verrouiller les permissions du répertoire tessdata. La version 5.5.3 marque un seuil de sécurité à ne pas ignorer, et la vérification en ligne de commande reste le seul moyen fiable de confirmer que tout fonctionne.