FeelTheFile

OCR: extrair texto de um PDF digitalizado

Reconhecimento óptico de caracteres 100% no seu navegador (tesseract). Extrai o texto de digitalizações e, se quiser, gera um PDF pesquisável.

Seus arquivos não saem do seu dispositivo

Como fazer OCR em um PDF

  1. 1

    Envie o PDF digitalizado

    E escolha o idioma do documento.

  2. 2

    Reconhecimento

    Cada página é processada no seu navegador com tesseract.

  3. 3

    Copie ou baixe

    O texto em .txt e, se quiser, um PDF pesquisável.

Por que usar esta ferramenta

  • 100% local

    O OCR roda no seu navegador: as digitalizações não são enviadas.

  • Espanhol e inglês

    Modelos treinados para ambos os idiomas, até combinados.

  • PDF pesquisável

    Camada de texto invisível opcional sobre a digitalização original.

  • Progresso real

    Você vê o avanço página a página, sem barras inventadas.

Perguntas frequentes

Qual é a precisão do OCR?

Com digitalizações nítidas (300 dpi, texto impresso) a precisão é alta. Manuscritos, fotos tortas ou baixa resolução a reduzem. O motor é o tesseract, o OCR livre de referência.

Por que a primeira vez demora mais?

São baixados o motor WASM e o modelo do idioma (uns 15 MB) deste mesmo site. Ficam em cache para as próximas vezes.

O que é o PDF pesquisável?

Sua digitalização original intacta mais uma camada de texto invisível alinhada com cada palavra: você poderá buscar com Ctrl+F e selecionar texto. O alinhamento é aproximado.

Meu documento é enviado a algum servidor?

Não. Todo o reconhecimento acontece no seu dispositivo; nem o PDF nem o texto saem do seu navegador.

Ferramentas relacionadas