PDF工具 / 11

扫描PDF转文本(OCR)

逐页读取没有可选文本的扫描PDF中的文字,全程在浏览器中完成。

扫描PDF转文本(OCR): TOEA会将每一页渲染为图片,逐页运行光学字符识别,并按页标记输出内容,方便你确认每段文字的来源。 完全在浏览器中本地运行,文件不会上传到服务器。

类别
PDF工具
使用次数
在浏览器中
费用
免费·无需注册
可用性
可直接使用
扫描版PDF→文本工作台本地处理

完全在浏览器中运行

↥
选择扫描版PDF

PDF · 最大30 MB,绝不会上传

获得更清晰的识别结果

每个页面都会以200 DPI渲染后再进行识别,因此识别效果取决于扫描件本身。以300 DPI扫描的正文通常能获得良好识别结果;倾斜拍摄的页面照片,或小字的传真质量扫描件,则会产生猜测结果。横向或倒置的页面识别效果很差,因此请先使用旋转PDF将页面转正,再运行识别。

请选择文档使用的语言,因为每种语言都是独立的模型。中文分为简体和繁体模型,选错模型会严重降低准确率。混合两种语言的文档,在大多数文本所使用的语言模型下识别效果最好。

检查识别结果

置信度数值是所有页面的平均值,因此一个糟糕的页面可能会被较高的总体分数掩盖。通常,90或更高表示只有偶发错误;低于75则意味着大多数段落中都会出现错误。常见混淆包括0和O、1、l和I、被识别为m的rn,以及被识别为S的5。这些问题在金额、日期和参考编号中影响最大,因此请将每个数字与页面逐一核对。

对于正文,请保持“将行合并为段落”处于开启状态,它会修复每个打印行末尾被拆开的句子。对于地址、列表和表格,请关闭此选项,因为这些内容中的换行具有实际意义。

使用方法

  1. 选择扫描PDF。
  2. 选择文本所使用的语言。
  3. 查看结果,并复制或下载文字。

隐私与限制

你的文件绝不会被上传。识别引擎和语言模型只需下载一次,大小约为10 MB,并由浏览器缓存;之后所有处理都在你的设备上运行。在线OCR服务则相反:它们需要获取你的文档。较长的文档处理需要一些时间,因为每一页都要先渲染,再依次识别。

相关工具

常见问题

什么时候应该使用这个工具,而不是“PDF转文本”?

请先使用“PDF转文本”——如果文档内部包含真正的文本,它会立即返回准确结果。只有在该工具没有返回任何内容时,才需要使用这个工具,这通常意味着页面是照片。

为什么处理速度很慢?

每一页都要先渲染为图片,然后逐字符读取。几页内容处理得很快;100页的扫描文档需要较长时间,而且必须保持标签页打开。

它会保留页面布局吗?

不会。列、表格和页眉会按照阅读顺序输出为普通文本行,因此复杂页面需要另外整理。

它能让PDF变得可搜索吗?

不能——这需要将不可见的文本层重新写入文件。本工具只会提供文字,方便你在其他地方使用。

免费工具·使用在浏览器中次·无需账户