OCR PDF文字识别
给扫描的PDF加上一层看不见的文字,就能在里面搜索、复制文字,而每一页的外观完全不变。
免费 · 无需注册 · 没有水印 · 文件不会离开你的设备
3步完成OCR PDF文字识别
- 选择扫描的PDF文件,或把它拖到框里。
- 选择文字的语言(如果文档混合两种语言,再选第二种),然后点击“开始识别”。
- 下载可搜索的PDF,或把识别出的全部文字下载为TXT文件。
OCR如何把扫描件变成可搜索的PDF
扫描的页面只是一张纸的照片:无法在里面搜索、选中一句话或复制一个数字。OCR(光学字符识别)会读出图片中的文字,并把它们作为一层看不见的文字加到页面上,正好叠在每个词的位置。页面看起来和原来一样,但现在按Ctrl+F就能找到词语,在Acrobat、预览、Chrome或Edge中可以选中和复制文字,Windows、macOS、Google云端硬盘或文档管理系统也能为文件建立索引。
文字识别由开源OCR引擎Tesseract在你的设备上完成。每页最高按300 DPI读取;已经有文字的页面保持原样,横着或倒着扫描的页面会被转到正确方向。清晰的印刷文字效果最好,例如信件、发票、合同、书籍和表格。手写字、极小的字、褪色的页面和斜着拍的照片错误会更多,表格会以文字形式输出,而不是单元格。第一次使用某种语言时,会从本网站下载它的识别模型(1到3 MB)并保存在浏览器里。中文和日文支持横排文字。
常见问题
做完OCR后,PDF的外观会变吗?
不会。原来的页面、图片和图形都不会被修改或重新压缩。OCR只是在每页上方加一层看不见的文字,所以文件看起来一样,每页只增加几KB。横着扫描的页面会被转正,方便阅读。
能识别哪些语言?
共24种:简体中文、繁体中文、英语、日语、韩语、西班牙语、法语、德语、葡萄牙语、俄语、阿拉伯语、越南语等。中英文混合的文档可以同时选择两种语言一起识别。中文和日文支持横排文字。
文字识别的准确率如何?
对于干净的印刷文字扫描件,几乎每个词都能识别正确:在我们用200 DPI办公扫描件做的测试中,超过98%的字符被正确读出。手写字、极小或花哨的字体、模糊的扫描和彩色背景会降低准确率,重要的名字和数字请再核对一遍。
OCR需要多长时间?
在较新的电脑上每页几秒钟,手机上大约是两倍时间,第一次使用还要加上短暂的语言模型下载。20页的扫描件通常需要一到三分钟。处理期间请保持标签页打开;已经有文字的页面会被跳过。
能把文字导出为TXT文件吗?
可以。除了可搜索的PDF,还可以把识别出的全部文字按页下载为TXT文件,直接粘贴到Word、Google文档或邮件里。照片和截图请使用我们的“图片转文字”工具,用法完全一样。
我的PDF会被上传到服务器吗?
不会。页面由在你浏览器里、在你自己设备上运行的OCR引擎识别,所以合同、病历和身份证件从不会发送给我们,也不会保存在任何地方。只有OCR引擎和语言模型会从本网站下载一次,并保存在浏览器里。