OCR: extrair texto de um PDF digitalizado
Reconhecimento óptico de caracteres 100% no seu navegador (tesseract). Extrai o texto de digitalizações e, se quiser, gera um PDF pesquisável.
Seus arquivos não saem do seu dispositivo
Como fazer OCR em um PDF
- 1
Envie o PDF digitalizado
E escolha o idioma do documento.
- 2
Reconhecimento
Cada página é processada no seu navegador com tesseract.
- 3
Copie ou baixe
O texto em .txt e, se quiser, um PDF pesquisável.
Por que usar esta ferramenta
100% local
O OCR roda no seu navegador: as digitalizações não são enviadas.
Espanhol e inglês
Modelos treinados para ambos os idiomas, até combinados.
PDF pesquisável
Camada de texto invisível opcional sobre a digitalização original.
Progresso real
Você vê o avanço página a página, sem barras inventadas.
Perguntas frequentes
Qual é a precisão do OCR?
Com digitalizações nítidas (300 dpi, texto impresso) a precisão é alta. Manuscritos, fotos tortas ou baixa resolução a reduzem. O motor é o tesseract, o OCR livre de referência.
Por que a primeira vez demora mais?
São baixados o motor WASM e o modelo do idioma (uns 15 MB) deste mesmo site. Ficam em cache para as próximas vezes.
O que é o PDF pesquisável?
Sua digitalização original intacta mais uma camada de texto invisível alinhada com cada palavra: você poderá buscar com Ctrl+F e selecionar texto. O alinhamento é aproximado.
Meu documento é enviado a algum servidor?
Não. Todo o reconhecimento acontece no seu dispositivo; nem o PDF nem o texto saem do seu navegador.