FeelTheFile

OCR : extraire le texte d'un PDF scanné

Reconnaissance optique de caractères 100 % dans votre navigateur (tesseract). Extrait le texte des scans et, si vous voulez, génère un PDF interrogeable.

Vos fichiers ne quittent pas votre appareil

Comment faire de l'OCR sur un PDF

  1. 1

    Envoyez le PDF scanné

    Et choisissez la langue du document.

  2. 2

    Reconnaissance

    Chaque page est traitée dans votre navigateur avec tesseract.

  3. 3

    Copiez ou téléchargez

    Le texte en .txt et, si vous voulez, un PDF interrogeable.

Pourquoi utiliser cet outil

  • 100 % local

    L'OCR s'exécute dans votre navigateur : les scans ne sont pas envoyés.

  • Espagnol et anglais

    Des modèles entraînés pour les deux langues, même combinées.

  • PDF interrogeable

    Couche de texte invisible optionnelle sur le scan original.

  • Progression réelle

    Vous voyez l'avancement page par page, sans barres inventées.

Questions fréquentes

Quelle est la précision de l'OCR ?

Avec des scans nets (300 dpi, texte imprimé), la précision est élevée. Manuscrits, photos de travers ou basse résolution la réduisent. Le moteur est tesseract, l'OCR libre de référence.

Pourquoi la première fois est-elle plus longue ?

Le moteur WASM et le modèle de langue (environ 15 Mo) sont téléchargés depuis ce site. Ils restent en cache pour les fois suivantes.

Qu'est-ce que le PDF interrogeable ?

Votre scan original intact plus une couche de texte invisible alignée sur chaque mot : vous pourrez chercher avec Ctrl+F et sélectionner du texte. L'alignement est approximatif.

Mon document est-il envoyé sur un serveur ?

Non. Toute la reconnaissance se déroule sur votre appareil ; ni le PDF ni le texte ne quittent votre navigateur.

Outils associés