Tesseract OCR continua a ser o motor de reconhecimento óptico de caracteres open source mais utilizado para extrair texto de imagens ou documentos digitalizados. Sua instalação no Windows parece simples à primeira vista, mas vários detalhes técnicos – variável de ambiente, escolha de versão, segurança dos modelos de língua – condicionam o bom funcionamento do software e a confiabilidade dos resultados.
Vulnerabilidade CVE-2026-73067: por que a versão do Tesseract é fundamental
Antes mesmo de iniciar um instalador, a primeira verificação diz respeito à versão do binário. Desde agosto de 2026, as versões do Tesseract anteriores a 5.5.3 estão afetadas pela vulnerabilidade CVE-2026-73067, um defeito do tipo heap out-of-bounds read acionado durante o carregamento de um arquivo .traineddata malicioso via TessBaseAPI::Init.
Na prática, um modelo de língua corrompido pode causar uma falha no processo antes mesmo do processamento da primeira imagem. Em uma estação de trabalho isolada, o risco parece limitado. Em um servidor de produção ou em uma cadeia CI/CD que processa documentos recebidos, a superfície de ataque se torna real.
A correção é direta: instalar o Tesseract na versão 5.5.3 ou superior. Se você já tiver uma versão mais antiga, o comando tesseract --version em um terminal confirmará o número exato. Qualquer versão inferior justifica uma atualização imediata. Um tutorial detalhado permite instalar o Tesseract OCR no Windows seguindo cada etapa desde o download do executável correto.
Baixar o instalador do Tesseract OCR para Windows 64 bits
Os binários do Windows do Tesseract são mantidos pela Universidade de Mannheim (UB Mannheim) e distribuídos em seu repositório no GitHub. Dois formatos são oferecidos: um instalador de 64 bits e um instalador de 32 bits. Quase todas as máquinas Windows atuais funcionam em 64 bits, portanto, é o arquivo tesseract-ocr-w64-setup que deve ser recuperado.

Uma vez que o arquivo .exe é baixado, o assistente de instalação é iniciado em alguns cliques. A tela de seleção de idioma diz respeito à interface do instalador, não aos idiomas de reconhecimento. Esse ponto gera regularmente confusão entre os usuários que pensam estar configurando o francês nesta etapa.
Seleção de componentes e modelos de língua
A etapa determinante do instalador é a seleção dos componentes. Por padrão, apenas o modelo de língua inglês (eng.traineddata) está marcado. Para reconhecer texto em francês, é necessário expandir a árvore de idiomas adicionais e marcar explicitamente o pacote de língua francesa (fra.traineddata).
Cada modelo de língua adiciona alguns megabytes. Não é necessário marcar tudo: selecione apenas os idiomas de que você precisa. Um diretório tessdata sobrecarregado com modelos não utilizados desacelera o carregamento inicial e amplia a superfície de exposição à vulnerabilidade mencionada acima.
Escolha do diretório de instalação
O instalador propõe um caminho padrão, geralmente C:Program FilesTesseract-OCR. Esse caminho é adequado na maioria dos casos. Modificar esse diretório não é um problema em si, mas será necessário relatar exatamente o novo caminho na variável de ambiente PATH, o que é uma fonte comum de erro.
Configurar a variável PATH e TESSDATA_PREFIX no Windows
A instalação do binário não é suficiente. Para que o comando tesseract seja reconhecido a partir de qualquer terminal (PowerShell, cmd, terminal integrado do VS Code), o diretório de instalação deve figurar na variável de ambiente PATH.
O procedimento passa pelos parâmetros do sistema avançados do Windows:
- Abrir o menu Iniciar, buscar “variáveis de ambiente” e clicar em “Modificar as variáveis de ambiente do sistema”
- No guia “Avançado”, clicar em “Variáveis de ambiente”, e então selecionar a variável
Pathna seção do usuário ou do sistema - Adicionar uma nova entrada com o caminho completo do diretório do Tesseract, por exemplo
C:Program FilesTesseract-OCR - Criar uma variável
TESSDATA_PREFIXapontando para o subdiretóriotessdata(por exemploC:Program FilesTesseract-OCRtessdata) para que o Tesseract localize seus modelos de língua
Após a modificação, todo terminal já aberto deve ser fechado e reaberto para considerar as novas variáveis. Este é um esquecimento clássico que leva a mensagens de erro do tipo 'tesseract' não é reconhecido como um comando interno.

Proteger o diretório tessdata após a instalação
A vulnerabilidade CVE-2026-73067 torna esta etapa menos anedótica do que parece. As recomendações de segurança publicadas em torno dessa falha insistem em várias medidas concretas:
- Limitar as fontes de modelos .traineddata a repositórios de confiança, idealmente os repositórios oficiais do projeto Tesseract no GitHub
- Restringir as permissões do diretório
tessdatapara leitura apenas para contas de serviço, com propriedade reservada à conta de administrador - Verificar a integridade dos arquivos de modelos baixados através de impressões SHA-256 antes de colocá-los no diretório
Em uma estação de desenvolvimento pessoal, essas precauções são boas práticas. Em uma máquina exposta a arquivos recebidos não controlados (servidor de digitalização, pipeline de processamento documental), elas se tornam uma necessidade operacional.
Verificar a instalação do Tesseract OCR via linha de comando
Uma vez que o PATH esteja configurado e o terminal reiniciado, a verificação consiste em dois comandos. O primeiro, tesseract --version, deve retornar um número de versão igual ou superior a 5.5.3. O segundo, tesseract --list-langs, exibe os idiomas efetivamente disponíveis no diretório tessdata.
Se o comando de versão funcionar, mas --list-langs não retornar nada ou apenas eng, o problema pode vir de um modelo de língua não marcado durante a instalação ou de uma variável TESSDATA_PREFIX mal configurada. Esses dois pontos concentram a maioria dos problemas relatados pelos usuários em fóruns técnicos.
Para um primeiro teste de reconhecimento, um comando do tipo tesseract image.png output -l fra gera um arquivo output.txt contendo o texto extraído. A qualidade do resultado depende fortemente da resolução da imagem fonte e do contraste entre o texto e o fundo. Imagens abaixo de 300 DPI produzem regularmente resultados degradados, sem que o motor OCR seja o culpado.
A instalação do Tesseract OCR no Windows consiste, afinal, em quatro operações: baixar o instalador correto de 64 bits, selecionar os modelos de língua adequados, configurar as variáveis de ambiente e, por fim, bloquear as permissões do diretório tessdata. A versão 5.5.3 marca um limite de segurança a não ser ignorado, e a verificação via linha de comando continua sendo o único meio confiável de confirmar que tudo está funcionando.



