OCR : extraire le texte d'un PDF scanné
Reconnaissance optique de caractères 100 % dans votre navigateur (tesseract). Extrait le texte des scans et, si vous voulez, génère un PDF interrogeable.
Vos fichiers ne quittent pas votre appareil
Comment faire de l'OCR sur un PDF
- 1
Envoyez le PDF scanné
Et choisissez la langue du document.
- 2
Reconnaissance
Chaque page est traitée dans votre navigateur avec tesseract.
- 3
Copiez ou téléchargez
Le texte en .txt et, si vous voulez, un PDF interrogeable.
Pourquoi utiliser cet outil
100 % local
L'OCR s'exécute dans votre navigateur : les scans ne sont pas envoyés.
Espagnol et anglais
Des modèles entraînés pour les deux langues, même combinées.
PDF interrogeable
Couche de texte invisible optionnelle sur le scan original.
Progression réelle
Vous voyez l'avancement page par page, sans barres inventées.
Questions fréquentes
Quelle est la précision de l'OCR ?
Avec des scans nets (300 dpi, texte imprimé), la précision est élevée. Manuscrits, photos de travers ou basse résolution la réduisent. Le moteur est tesseract, l'OCR libre de référence.
Pourquoi la première fois est-elle plus longue ?
Le moteur WASM et le modèle de langue (environ 15 Mo) sont téléchargés depuis ce site. Ils restent en cache pour les fois suivantes.
Qu'est-ce que le PDF interrogeable ?
Votre scan original intact plus une couche de texte invisible alignée sur chaque mot : vous pourrez chercher avec Ctrl+F et sélectionner du texte. L'alignement est approximatif.
Mon document est-il envoyé sur un serveur ?
Non. Toute la reconnaissance se déroule sur votre appareil ; ni le PDF ni le texte ne quittent votre navigateur.