FeelTheFile

OCR: Text aus einem gescannten PDF extrahieren

Optische Zeichenerkennung zu 100 % in deinem Browser (tesseract). Extrahiert den Text aus Scans und erzeugt auf Wunsch ein durchsuchbares PDF.

Deine Dateien verlassen dein Gerät nicht

So machst du OCR auf einem PDF

  1. 1

    Gescanntes PDF hochladen

    Und wähle die Sprache des Dokuments.

  2. 2

    Erkennung

    Jede Seite wird in deinem Browser mit tesseract verarbeitet.

  3. 3

    Kopieren oder herunterladen

    Den Text als .txt und, auf Wunsch, ein durchsuchbares PDF.

Warum dieses Tool

  • 100 % lokal

    Das OCR läuft in deinem Browser: Die Scans werden nicht hochgeladen.

  • Spanisch und Englisch

    Für beide Sprachen trainierte Modelle, auch kombiniert.

  • Durchsuchbares PDF

    Optionale unsichtbare Textebene über dem Originalscan.

  • Echter Fortschritt

    Du siehst den Fortschritt Seite für Seite, ohne erfundene Balken.

Häufige Fragen

Wie genau ist das OCR?

Bei scharfen Scans (300 dpi, gedruckter Text) ist die Genauigkeit hoch. Handschrift, schiefe Fotos oder niedrige Auflösung senken sie. Der Motor ist tesseract, das freie Referenz-OCR.

Warum dauert das erste Mal länger?

Die WASM-Engine und das Sprachmodell (rund 15 MB) werden von dieser Website geladen. Sie bleiben für die nächsten Male im Cache.

Was ist das durchsuchbare PDF?

Dein Originalscan unverändert plus eine unsichtbare, an jedem Wort ausgerichtete Textebene: Du kannst mit Strg+F suchen und Text auswählen. Die Ausrichtung ist näherungsweise.

Wird mein Dokument auf einen Server hochgeladen?

Nein. Die gesamte Erkennung passiert auf deinem Gerät; weder das PDF noch der Text verlassen deinen Browser.

Verwandte Tools