OCR PDF
Dodaj do zeskanowanego PDF niewidoczną warstwę tekstu, aby móc go przeszukiwać i kopiować z niego tekst, bez zmiany wyglądu żadnej strony.
lub upuść go tutaj · do 50 MB, za darmo
Większe pliki? Pro konwertuje pliki do 500 MBPonad darmowe limity: pobieranie odblokujesz już od 1,99 €.
Przetwarzanie…
Twój plik jest gotowy
Za darmo · Bez rejestracji · Bez znaku wodnego · Twoje pliki nie opuszczają urządzenia
OCR PDF w 3 krokach
- Wybierz zeskanowany PDF lub przeciągnij go do ramki.
- Wybierz język tekstu (i drugi, jeśli dokument łączy dwa), a potem kliknij Uruchom OCR.
- Pobierz przeszukiwalny PDF albo cały rozpoznany tekst w pliku TXT.
Jak OCR zamienia skan w przeszukiwalny PDF
Zeskanowana strona to tylko zdjęcie kartki: nie da się w niej nic wyszukać, zaznaczyć zdania ani skopiować kwoty. OCR (optyczne rozpoznawanie znaków) odczytuje litery z tego obrazu i dodaje je do strony jako niewidoczną warstwę tekstu, ułożoną dokładnie nad każdym słowem. Strona wygląda tak samo jak wcześniej, ale Ctrl+F znajduje teraz słowa, tekst można zaznaczać i kopiować w Acrobacie, Podglądzie, Chrome czy Edge, a Windows, macOS, Dysk Google lub system obiegu dokumentów mogą plik indeksować.
Tekst jest rozpoznawany na Twoim urządzeniu przez Tesseract, otwartoźródłowy silnik OCR. Każda strona jest odczytywana w rozdzielczości do 300 DPI; strony, które mają już tekst, zostają bez zmian, a te zeskanowane bokiem lub do góry nogami są obracane do właściwej pozycji. Najlepiej działa z wyraźnym tekstem drukowanym, takim jak pisma, faktury, umowy, książki i formularze. Pismo odręczne, bardzo mała czcionka, wyblakłe strony i zdjęcia robione pod kątem dają więcej błędów, a tabele wychodzą jako tekst, nie jako komórki. Gdy pierwszy raz używasz danego języka, jego model rozpoznawania (od 1 do 3 MB) pobiera się z tej strony i zostaje w przeglądarce.
Najczęściej zadawane pytania
Czy mój PDF będzie wyglądał inaczej po OCR?
Nie. Oryginalne strony, obrazy i grafiki nie są zmieniane ani ponownie kompresowane. OCR dodaje tylko niewidoczną warstwę tekstu nad każdą stroną, więc plik wygląda tak samo i rośnie o kilka kilobajtów na stronę. Strony zeskanowane bokiem są obracane, żeby łatwiej się je czytało.
Jakie języki potrafi odczytać?
Dwadzieścia cztery: polski, angielski, niemiecki, hiszpański, francuski, włoski, portugalski, niderlandzki, turecki, indonezyjski, wietnamski, japoński, chiński uproszczony i tradycyjny, koreański, rosyjski, ukraiński, arabski, hindi, kataloński, czeski, grecki, rumuński i szwedzki. Dla dokumentów łączących języki, na przykład polski i angielski, możesz wybrać dwa naraz.
Jak dokładne jest rozpoznawanie tekstu?
Przy czystym skanie tekstu drukowanego prawie każde słowo jest poprawne: w naszych testach na biurowych skanach w 200 DPI dobrze odczytano ponad 98 procent znaków. Pismo odręczne, drobne lub ozdobne czcionki, nieostre skany i kolorowe tło obniżają dokładność, więc sprawdź ważne nazwiska i liczby.
Ile trwa OCR?
Kilka sekund na stronę na nowym komputerze i mniej więcej dwa razy dłużej na telefonie, a za pierwszym razem dochodzi krótkie pobieranie modelu języka. Skan z 20 stronami zajmuje zwykle od jednej do trzech minut. Nie zamykaj karty w trakcie pracy; strony, które mają już tekst, są pomijane.
Czy mogę dostać tekst w pliku TXT?
Tak. Obok przeszukiwalnego PDF możesz pobrać cały rozpoznany tekst w pliku TXT, strona po stronie, gotowy do wklejenia do Worda, Dokumentów Google lub e-maila. Do zdjęć i zrzutów ekranu użyj naszego narzędzia Zdjęcie na tekst, które działa tak samo.
Czy mój PDF trafia na serwer?
Nie. Strony odczytuje silnik OCR działający w Twojej przeglądarce, na Twoim własnym urządzeniu, więc umowy, dokumentacja medyczna i dowody osobiste nigdy do nas nie trafiają ani nie są nigdzie zapisywane. Z tej strony pobierane są tylko raz silnik OCR i model języka, które zostają w przeglądarce.