OCR: Text aus einem gescannten PDF extrahieren
Optische Zeichenerkennung zu 100 % in deinem Browser (tesseract). Extrahiert den Text aus Scans und erzeugt auf Wunsch ein durchsuchbares PDF.
Deine Dateien verlassen dein Gerät nicht
So machst du OCR auf einem PDF
- 1
Gescanntes PDF hochladen
Und wähle die Sprache des Dokuments.
- 2
Erkennung
Jede Seite wird in deinem Browser mit tesseract verarbeitet.
- 3
Kopieren oder herunterladen
Den Text als .txt und, auf Wunsch, ein durchsuchbares PDF.
Warum dieses Tool
100 % lokal
Das OCR läuft in deinem Browser: Die Scans werden nicht hochgeladen.
Spanisch und Englisch
Für beide Sprachen trainierte Modelle, auch kombiniert.
Durchsuchbares PDF
Optionale unsichtbare Textebene über dem Originalscan.
Echter Fortschritt
Du siehst den Fortschritt Seite für Seite, ohne erfundene Balken.
Häufige Fragen
Wie genau ist das OCR?
Bei scharfen Scans (300 dpi, gedruckter Text) ist die Genauigkeit hoch. Handschrift, schiefe Fotos oder niedrige Auflösung senken sie. Der Motor ist tesseract, das freie Referenz-OCR.
Warum dauert das erste Mal länger?
Die WASM-Engine und das Sprachmodell (rund 15 MB) werden von dieser Website geladen. Sie bleiben für die nächsten Male im Cache.
Was ist das durchsuchbare PDF?
Dein Originalscan unverändert plus eine unsichtbare, an jedem Wort ausgerichtete Textebene: Du kannst mit Strg+F suchen und Text auswählen. Die Ausrichtung ist näherungsweise.
Wird mein Dokument auf einen Server hochgeladen?
Nein. Die gesamte Erkennung passiert auf deinem Gerät; weder das PDF noch der Text verlassen deinen Browser.