OCR PDF
Thêm một lớp chữ ẩn vào file PDF scan để bạn tìm kiếm và sao chép chữ trong đó, mà giao diện của từng trang vẫn giữ nguyên.
hoặc kéo thả vào đây · tối đa 50 MB, miễn phí
Cần file lớn hơn? Pro chuyển đổi file tới 500 MBVượt giới hạn miễn phí: bạn có thể mở khóa tải về chỉ từ 1,99 €.
Đang xử lý…
File của bạn đã sẵn sàng
Miễn phí · Không cần đăng ký · Không hình mờ · File không rời khỏi thiết bị của bạn
OCR PDF trong 3 bước
- Chọn file PDF scan của bạn hoặc kéo thả vào khung.
- Chọn ngôn ngữ của văn bản (và thêm ngôn ngữ thứ hai nếu tài liệu dùng hai thứ tiếng), rồi bấm Chạy OCR.
- Tải về PDF tìm kiếm được, hoặc toàn bộ văn bản nhận dạng được dưới dạng file TXT.
OCR biến bản scan thành PDF tìm kiếm được như thế nào
Một trang scan chỉ là ảnh chụp tờ giấy: bạn không thể tìm chữ, bôi đen một câu hay sao chép một con số trong đó. OCR (nhận dạng ký tự quang học) đọc các chữ cái trong ảnh và thêm chúng vào trang thành một lớp chữ ẩn, đặt chính xác lên trên từng từ. Trang vẫn trông y như cũ, nhưng giờ Ctrl+F tìm được chữ, bạn có thể bôi đen và sao chép trong Acrobat, Preview, Chrome hay Edge, và Windows, macOS, Google Drive hoặc hệ thống lưu trữ tài liệu có thể lập chỉ mục cho file.
Chữ được nhận dạng ngay trên thiết bị của bạn bằng Tesseract, một bộ máy OCR mã nguồn mở. Mỗi trang được đọc ở độ phân giải tối đa 300 DPI; trang nào đã có chữ thì giữ nguyên, còn trang bị scan nằm ngang hoặc lộn ngược sẽ được xoay lại cho đúng chiều. Kết quả tốt nhất với chữ in rõ nét như thư từ, hóa đơn, hợp đồng, sách và biểu mẫu. Chữ viết tay, chữ quá nhỏ, trang bị mờ và ảnh chụp nghiêng sẽ có nhiều lỗi hơn, còn bảng biểu chỉ ra dạng chữ chứ không thành ô. Lần đầu bạn dùng một ngôn ngữ, mô hình đọc chữ của ngôn ngữ đó (từ 1 đến 3 MB) được tải từ trang này và lưu lại trong trình duyệt.
Câu hỏi thường gặp
Sau khi OCR, file PDF có bị thay đổi giao diện không?
Không. Các trang, hình ảnh và hình vẽ gốc không bị chỉnh sửa hay nén lại. OCR chỉ thêm một lớp chữ ẩn lên trên mỗi trang, nên file trông y hệt và chỉ nặng thêm vài kilobyte mỗi trang. Những trang bị scan nằm ngang sẽ được xoay thẳng lại cho dễ đọc.
Công cụ đọc được những ngôn ngữ nào?
Hai mươi bốn ngôn ngữ: tiếng Việt, Anh, Pháp, Đức, Tây Ban Nha, Ý, Bồ Đào Nha, Hà Lan, Ba Lan, Thổ Nhĩ Kỳ, Indonesia, Nhật, Trung giản thể và phồn thể, Hàn, Nga, Ukraina, Ả Rập, Hindi, Catalan, Séc, Hy Lạp, Romania và Thụy Điển. Với tài liệu dùng hai thứ tiếng, như tiếng Việt và tiếng Anh, bạn có thể chọn cả hai cùng lúc.
Nhận dạng chữ chính xác đến mức nào?
Với bản scan sạch của chữ in, gần như mọi từ đều đúng: trong thử nghiệm của chúng tôi với bản scan văn phòng ở 200 DPI, hơn 98% ký tự được đọc chính xác. Chữ viết tay, phông chữ quá nhỏ hoặc cách điệu, bản scan bị mờ và nền có màu sẽ làm giảm độ chính xác, vì vậy hãy kiểm tra lại tên và con số quan trọng.
OCR mất bao lâu?
Vài giây mỗi trang trên máy tính đời mới và lâu hơn khoảng gấp đôi trên điện thoại, cộng thêm lần tải mô hình ngôn ngữ ngắn ở lần đầu. Một bản scan 20 trang thường mất từ một đến ba phút. Hãy để tab mở trong lúc xử lý; những trang đã có chữ sẽ được bỏ qua.
Tôi có lấy được văn bản dưới dạng file TXT không?
Có. Bên cạnh file PDF tìm kiếm được, bạn có thể tải toàn bộ văn bản nhận dạng được trong một file TXT, theo từng trang, sẵn sàng dán vào Word, Google Tài liệu hay email. Với ảnh chụp và ảnh chụp màn hình, hãy dùng công cụ Chuyển ảnh thành văn bản của chúng tôi, hoạt động y như vậy.
File PDF của tôi có bị tải lên máy chủ không?
Không. Các trang được đọc bởi một bộ máy OCR chạy ngay trong trình duyệt, trên chính thiết bị của bạn, nên hợp đồng, giấy tờ y tế hay giấy tờ tùy thân không bao giờ được gửi cho chúng tôi hay lưu ở đâu cả. Chỉ có bộ máy OCR và mô hình ngôn ngữ được tải một lần từ trang này và lưu trong trình duyệt.