OCR PDF
Voeg een onzichtbare tekstlaag toe aan een gescande PDF, zodat je erin kunt zoeken en tekst kunt kopiëren, terwijl elke pagina er precies hetzelfde uitziet.
of sleep het hierheen · tot 50 MB, gratis
Grotere bestanden? Met Pro zet je bestanden tot 500 MB omBoven de gratis limieten: je kunt de download vrijgeven vanaf € 1,99.
Bezig…
Je bestand is klaar
Gratis · Geen account · Geen watermerk · Je bestanden verlaten je apparaat niet
OCR PDF in 3 stappen
- Kies je gescande PDF of sleep hem naar het vak.
- Kies de taal van de tekst (en een tweede als het document twee talen mengt) en klik op OCR uitvoeren.
- Download de doorzoekbare PDF, of alle herkende tekst als TXT-bestand.
Zo maakt OCR van een scan een doorzoekbare PDF
Een gescande pagina is alleen een foto van papier: je kunt er niet in zoeken, geen zin selecteren en geen bedrag kopiëren. OCR (optische tekenherkenning) leest de letters in die afbeelding en voegt ze aan de pagina toe als onzichtbare tekstlaag, precies boven elk woord. De pagina ziet er hetzelfde uit, maar Ctrl+F vindt nu woorden, je kunt tekst markeren en kopiëren in Acrobat, Voorvertoning, Chrome of Edge, en Windows, macOS, Google Drive of je documentbeheersysteem kan het bestand indexeren.
De tekst wordt op je eigen apparaat herkend door Tesseract, een opensource-OCR-engine. Elke pagina wordt gelezen met maximaal 300 dpi; pagina's die al tekst bevatten blijven zoals ze zijn, en pagina's die zijwaarts of ondersteboven zijn gescand worden rechtop gedraaid. Het werkt het best met duidelijke gedrukte tekst, zoals brieven, facturen, contracten, boeken en formulieren. Handschrift, heel kleine letters, verbleekte pagina's en scheef genomen foto's geven meer fouten, en tabellen komen eruit als tekst, niet als cellen. De eerste keer dat je een taal gebruikt, wordt het leesmodel ervan (1 tot 3 MB) van deze site gedownload en in je browser bewaard.
Veelgestelde vragen
Ziet mijn PDF er na OCR anders uit?
Nee. De oorspronkelijke pagina's, afbeeldingen en tekeningen worden niet veranderd of opnieuw gecomprimeerd. OCR voegt alleen een onzichtbare tekstlaag toe boven elke pagina, dus het bestand ziet er hetzelfde uit en wordt per pagina maar een paar kilobyte groter. Zijwaarts gescande pagina's worden rechtop gezet zodat ze beter leesbaar zijn.
Welke talen kan het lezen?
Vierentwintig: Nederlands, Engels, Duits, Frans, Spaans, Italiaans, Portugees, Pools, Turks, Indonesisch, Vietnamees, Japans, vereenvoudigd en traditioneel Chinees, Koreaans, Russisch, Oekraïens, Arabisch, Hindi, Catalaans, Tsjechisch, Grieks, Roemeens en Zweeds. Voor documenten met twee talen, zoals Nederlands en Engels, kies je er twee tegelijk.
Hoe nauwkeurig is de tekstherkenning?
Bij een nette scan van gedrukte tekst klopt bijna elk woord: in onze tests met kantoorscans op 200 dpi werd meer dan 98 procent van de tekens goed gelezen. Handschrift, piepkleine of sierlijke lettertypen, wazige scans en gekleurde achtergronden verlagen de nauwkeurigheid, dus controleer belangrijke namen en bedragen.
Hoe lang duurt OCR?
Een paar seconden per pagina op een recente computer en ongeveer twee keer zo lang op een telefoon, plus de eerste keer een korte download van het taalmodel. Een scan van 20 pagina's duurt meestal één tot drie minuten. Laat het tabblad open terwijl het werkt; pagina's die al tekst hebben worden overgeslagen.
Kan ik de tekst als TXT-bestand krijgen?
Ja. Naast de doorzoekbare PDF kun je alle herkende tekst downloaden als TXT-bestand, pagina voor pagina, klaar om te plakken in Word, Google Documenten of een e-mail. Gebruik voor foto's en schermafbeeldingen onze tool Afbeelding naar tekst, die op dezelfde manier werkt.
Wordt mijn PDF naar een server geüpload?
Nee. De pagina's worden gelezen door een OCR-engine die in je browser op je eigen apparaat draait, dus contracten, medische brieven en identiteitsbewijzen worden nooit naar ons gestuurd of ergens opgeslagen. Alleen de OCR-engine en het taalmodel worden eenmalig van deze site gedownload en in je browser bewaard.