Skip to content
freeonlinefileconvert

OCR PDF文字识别

给扫描的PDF加上一层看不见的文字,就能在里面搜索、复制文字,而每一页的外观完全不变。

或拖放到这里 · 最大50MB,免费

文件更大?Pro可转换最大500MB的文件

已超出免费版上限

你仍然可以继续:现在就转换,只有在想下载结果时才需支付€1.99。

免费版支持单个文件最大50 MB,一次最多20个文件。

免费 · 无需注册 · 没有水印 · 文件不会离开你的设备

3步完成OCR PDF文字识别

  1. 选择扫描的PDF文件,或把它拖到框里。
  2. 选择文字的语言(如果文档混合两种语言,再选第二种),然后点击“开始识别”。
  3. 下载可搜索的PDF,或把识别出的全部文字下载为TXT文件。

OCR如何把扫描件变成可搜索的PDF

扫描的页面只是一张纸的照片:无法在里面搜索、选中一句话或复制一个数字。OCR(光学字符识别)会读出图片中的文字,并把它们作为一层看不见的文字加到页面上,正好叠在每个词的位置。页面看起来和原来一样,但现在按Ctrl+F就能找到词语,在Acrobat、预览、Chrome或Edge中可以选中和复制文字,Windows、macOS、Google云端硬盘或文档管理系统也能为文件建立索引。

文字识别由开源OCR引擎Tesseract在你的设备上完成。每页最高按300 DPI读取;已经有文字的页面保持原样,横着或倒着扫描的页面会被转到正确方向。清晰的印刷文字效果最好,例如信件、发票、合同、书籍和表格。手写字、极小的字、褪色的页面和斜着拍的照片错误会更多,表格会以文字形式输出,而不是单元格。第一次使用某种语言时,会从本网站下载它的识别模型(1到3 MB)并保存在浏览器里。中文和日文支持横排文字。

常见问题

做完OCR后,PDF的外观会变吗?

不会。原来的页面、图片和图形都不会被修改或重新压缩。OCR只是在每页上方加一层看不见的文字,所以文件看起来一样,每页只增加几KB。横着扫描的页面会被转正,方便阅读。

能识别哪些语言?

共24种:简体中文、繁体中文、英语、日语、韩语、西班牙语、法语、德语、葡萄牙语、俄语、阿拉伯语、越南语等。中英文混合的文档可以同时选择两种语言一起识别。中文和日文支持横排文字。

文字识别的准确率如何?

对于干净的印刷文字扫描件,几乎每个词都能识别正确:在我们用200 DPI办公扫描件做的测试中,超过98%的字符被正确读出。手写字、极小或花哨的字体、模糊的扫描和彩色背景会降低准确率,重要的名字和数字请再核对一遍。

OCR需要多长时间?

在较新的电脑上每页几秒钟,手机上大约是两倍时间,第一次使用还要加上短暂的语言模型下载。20页的扫描件通常需要一到三分钟。处理期间请保持标签页打开;已经有文字的页面会被跳过。

能把文字导出为TXT文件吗?

可以。除了可搜索的PDF,还可以把识别出的全部文字按页下载为TXT文件,直接粘贴到Word、Google文档或邮件里。照片和截图请使用我们的“图片转文字”工具,用法完全一样。

我的PDF会被上传到服务器吗?

不会。页面由在你浏览器里、在你自己设备上运行的OCR引擎识别,所以合同、病历和身份证件从不会发送给我们,也不会保存在任何地方。只有OCR引擎和语言模型会从本网站下载一次,并保存在浏览器里。

相关工具

你是首批用户之一

FreeOnlineFileConvert刚刚上线。现在创建免费账户,加入我们的Family & Friends名单:完整的Pro套餐,终身免费。

Pro0 €6,99 €
免费加入