OCR PDF
Tambahkan lapisan teks tak terlihat ke PDF hasil scan agar Anda bisa mencari kata dan menyalin teksnya, tanpa mengubah tampilan halaman mana pun.
atau seret ke sini · hingga 50 MB, gratis
File lebih besar? Pro bisa mengonversi file hingga 500 MBMelebihi batas gratis: Anda bisa membuka unduhan mulai €1,99.
Sedang diproses…
File Anda sudah siap
Gratis · Tanpa daftar · Tanpa watermark · File tidak pernah keluar dari perangkat Anda
OCR PDF dalam 3 langkah
- Pilih PDF hasil scan Anda, atau seret ke dalam kotak.
- Pilih bahasa teksnya (dan bahasa kedua jika dokumen memakai dua bahasa), lalu klik Jalankan OCR.
- Unduh PDF yang bisa dicari, atau seluruh teks yang terbaca dalam file TXT.
Cara OCR mengubah hasil scan menjadi PDF yang bisa dicari
Halaman hasil scan hanyalah foto kertas: Anda tidak bisa mencari kata, memilih kalimat, atau menyalin angka di dalamnya. OCR (pengenalan karakter optik) membaca huruf di gambar itu dan menambahkannya ke halaman sebagai lapisan teks tak terlihat, tepat di atas setiap kata. Halaman tetap terlihat sama, tetapi kini Ctrl+F bisa menemukan kata, Anda bisa menandai dan menyalin teks di Acrobat, Preview, Chrome, atau Edge, dan Windows, macOS, Google Drive, atau sistem arsip Anda bisa mengindeks file tersebut.
Teks dikenali di perangkat Anda oleh Tesseract, mesin OCR sumber terbuka. Setiap halaman dibaca hingga 300 DPI; halaman yang sudah berisi teks dibiarkan apa adanya, dan halaman yang ter-scan miring ke samping atau terbalik diputar ke posisi yang benar. Hasil terbaik didapat dari teks cetak yang jelas, seperti surat, faktur, kontrak, buku, dan formulir. Tulisan tangan, huruf sangat kecil, halaman pudar, dan foto yang diambil miring menghasilkan lebih banyak kesalahan, dan tabel keluar sebagai teks, bukan sel. Saat pertama kali memakai suatu bahasa, model pembacanya (1 sampai 3 MB) diunduh dari situs ini dan disimpan di browser Anda.
Pertanyaan yang sering diajukan
Apakah tampilan PDF saya berubah setelah OCR?
Tidak. Halaman, gambar, dan grafik asli tidak diubah atau dikompres ulang. OCR hanya menambahkan lapisan teks tak terlihat di atas setiap halaman, jadi file terlihat sama dan hanya bertambah beberapa kilobita per halaman. Halaman yang ter-scan menyamping diputar tegak agar lebih mudah dibaca.
Bahasa apa saja yang bisa dibaca?
Dua puluh empat: Indonesia, Inggris, Spanyol, Prancis, Jerman, Italia, Portugis, Belanda, Polandia, Turki, Vietnam, Jepang, Tionghoa sederhana dan tradisional, Korea, Rusia, Ukraina, Arab, Hindi, Katalan, Ceko, Yunani, Rumania, dan Swedia. Anda bisa memilih dua sekaligus untuk dokumen yang mencampur bahasa, misalnya Indonesia dan Inggris.
Seberapa akurat pengenalan teksnya?
Pada hasil scan teks cetak yang bersih, hampir semua kata terbaca benar: dalam pengujian kami pada hasil scan kantor 200 DPI, lebih dari 98 persen karakter terbaca dengan tepat. Tulisan tangan, huruf sangat kecil atau dekoratif, scan yang buram, dan latar berwarna menurunkan akurasi, jadi periksa nama dan angka yang penting.
Berapa lama proses OCR?
Beberapa detik per halaman di komputer yang cukup baru dan kira-kira dua kali lebih lama di ponsel, ditambah unduhan singkat model bahasa saat pertama kali. Hasil scan 20 halaman biasanya selesai dalam satu sampai tiga menit. Biarkan tab tetap terbuka selama proses; halaman yang sudah berisi teks dilewati.
Bisakah saya mendapatkan teksnya dalam file TXT?
Bisa. Di samping PDF yang bisa dicari, Anda bisa mengunduh seluruh teks yang terbaca dalam file TXT, per halaman, siap ditempel ke Word, Google Dokumen, atau email. Untuk foto dan tangkapan layar, gunakan alat Gambar ke Teks kami yang cara kerjanya sama.
Apakah PDF saya diunggah ke server?
Tidak. Halaman dibaca oleh mesin OCR yang berjalan di dalam browser, di perangkat Anda sendiri, jadi kontrak, surat medis, dan dokumen identitas tidak pernah dikirim ke kami atau disimpan di mana pun. Hanya mesin OCR dan model bahasa yang diunduh dari situs ini, sekali saja, lalu disimpan di browser Anda.