OCR PDF
Legen Sie eine unsichtbare Textebene über ein gescanntes PDF, damit Sie darin suchen und Text kopieren können, ohne dass sich das Aussehen der Seiten ändert.
oder hierher ziehen · bis 50 MB, kostenlos
Größere Dateien? Mit Pro wandeln Sie Dateien bis 500 MB umÜber den Gratis-Limits: Sie können den Download ab 1,99 € freischalten.
Wird verarbeitet …
Ihre Datei ist fertig
Kostenlos · Ohne Anmeldung · Ohne Wasserzeichen · Ihre Dateien verlassen Ihr Gerät nicht
OCR PDF in 3 Schritten
- Wählen Sie Ihr gescanntes PDF aus oder ziehen Sie es in das Feld.
- Wählen Sie die Sprache des Textes (und eine zweite, wenn das Dokument zwei mischt) und klicken Sie auf OCR starten.
- Laden Sie das durchsuchbare PDF herunter oder den gesamten erkannten Text als TXT-Datei.
So macht OCR aus einem Scan ein durchsuchbares PDF
Eine gescannte Seite ist nur ein Foto von Papier: Sie können darin nicht suchen, keinen Satz markieren und keine Zahl kopieren. OCR (optische Zeichenerkennung) liest die Buchstaben auf diesem Bild und legt sie als unsichtbare Textebene genau über jedes Wort. Die Seite sieht aus wie vorher, aber Strg+F findet jetzt Wörter, Sie können in Acrobat, Vorschau, Chrome oder Edge Text markieren und kopieren, und Windows, macOS, Google Drive oder Ihr Dokumentenmanagement können die Datei indexieren.
Der Text wird auf Ihrem Gerät mit Tesseract erkannt, einer quelloffenen OCR-Engine. Jede Seite wird mit bis zu 300 dpi gelesen; Seiten, die schon Text enthalten, bleiben unverändert, und quer oder kopfüber gescannte Seiten werden richtig herum gedreht. Am besten funktioniert es mit klar gedrucktem Text wie Briefen, Rechnungen, Verträgen, Büchern und Formularen. Handschrift, sehr kleine Schrift, verblasste Seiten und schräg aufgenommene Fotos führen zu mehr Fehlern, und Tabellen kommen als Text heraus, nicht als Zellen. Beim ersten Einsatz einer Sprache wird ihr Lesemodell (1 bis 3 MB) von dieser Website geladen und in Ihrem Browser gespeichert.
Häufige Fragen
Sieht mein PDF nach der Texterkennung anders aus?
Nein. Die ursprünglichen Seiten, Bilder und Grafiken werden weder verändert noch neu komprimiert. OCR legt nur eine unsichtbare Textebene über jede Seite, daher sieht die Datei gleich aus und wird pro Seite nur wenige Kilobyte größer. Quer gescannte Seiten werden aufgerichtet, damit sie sich leichter lesen lassen.
Welche Sprachen werden erkannt?
Vierundzwanzig: Deutsch, Englisch, Spanisch, Französisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Türkisch, Indonesisch, Vietnamesisch, Japanisch, vereinfachtes und traditionelles Chinesisch, Koreanisch, Russisch, Ukrainisch, Arabisch, Hindi, Katalanisch, Tschechisch, Griechisch, Rumänisch und Schwedisch. Für gemischte Dokumente, etwa Deutsch und Englisch, wählen Sie zwei auf einmal.
Wie genau ist die Texterkennung?
Bei einem sauberen Scan von gedrucktem Text stimmt fast jedes Wort: In unseren Tests mit Büroscans bei 200 dpi wurden mehr als 98 Prozent der Zeichen richtig gelesen. Handschrift, winzige oder verschnörkelte Schriften, unscharfe Scans und farbige Hintergründe senken die Genauigkeit, prüfen Sie also wichtige Namen und Zahlen.
Wie lange dauert die Texterkennung?
Einige Sekunden pro Seite auf einem aktuellen Computer und etwa doppelt so lange auf dem Handy, beim ersten Mal kommt ein kurzer Download des Sprachmodells dazu. Ein Scan mit 20 Seiten dauert meist ein bis drei Minuten. Lassen Sie den Tab dabei offen; Seiten mit vorhandenem Text werden übersprungen.
Bekomme ich den Text auch als TXT-Datei?
Ja. Neben dem durchsuchbaren PDF können Sie den gesamten erkannten Text als TXT-Datei herunterladen, Seite für Seite, bereit zum Einfügen in Word, Google Docs oder eine E-Mail. Für Fotos und Screenshots nutzen Sie unser Tool „Bild in Text“, das genauso funktioniert.
Wird mein PDF auf einen Server hochgeladen?
Nein. Die Seiten liest eine OCR-Engine, die in Ihrem Browser auf Ihrem eigenen Gerät läuft, daher werden Verträge, Arztbriefe und Ausweise nie an uns gesendet oder irgendwo gespeichert. Nur die OCR-Engine und das Sprachmodell werden einmalig von dieser Website geladen und in Ihrem Browser behalten.