PDF工具 / 11
扫描PDF转文本(OCR)
逐页读取没有可选文本的扫描PDF中的文字,全程在浏览器中完成。
扫描PDF转文本(OCR): TOEA会将每一页渲染为图片,逐页运行光学字符识别,并按页标记输出内容,方便你确认每段文字的来源。 完全在浏览器中本地运行,文件不会上传到服务器。
- 类别
- PDF工具
- 使用次数
- 在浏览器中
- 费用
- 免费·无需注册
- 可用性
- 可直接使用
完全在浏览器中运行
PDF · 最大30 MB,绝不会上传
获得更清晰的识别结果
每个页面都会以200 DPI渲染后再进行识别,因此识别效果取决于扫描件本身。以300 DPI扫描的正文通常能获得良好识别结果;倾斜拍摄的页面照片,或小字的传真质量扫描件,则会产生猜测结果。横向或倒置的页面识别效果很差,因此请先使用旋转PDF将页面转正,再运行识别。
请选择文档使用的语言,因为每种语言都是独立的模型。中文分为简体和繁体模型,选错模型会严重降低准确率。混合两种语言的文档,在大多数文本所使用的语言模型下识别效果最好。
检查识别结果
置信度数值是所有页面的平均值,因此一个糟糕的页面可能会被较高的总体分数掩盖。通常,90或更高表示只有偶发错误;低于75则意味着大多数段落中都会出现错误。常见混淆包括0和O、1、l和I、被识别为m的rn,以及被识别为S的5。这些问题在金额、日期和参考编号中影响最大,因此请将每个数字与页面逐一核对。
对于正文,请保持“将行合并为段落”处于开启状态,它会修复每个打印行末尾被拆开的句子。对于地址、列表和表格,请关闭此选项,因为这些内容中的换行具有实际意义。
使用方法
- 选择扫描PDF。
- 选择文本所使用的语言。
- 查看结果,并复制或下载文字。
隐私与限制
你的文件绝不会被上传。识别引擎和语言模型只需下载一次,大小约为10 MB,并由浏览器缓存;之后所有处理都在你的设备上运行。在线OCR服务则相反:它们需要获取你的文档。较长的文档处理需要一些时间,因为每一页都要先渲染,再依次识别。
相关工具
常见问题
什么时候应该使用这个工具,而不是“PDF转文本”?
请先使用“PDF转文本”——如果文档内部包含真正的文本,它会立即返回准确结果。只有在该工具没有返回任何内容时,才需要使用这个工具,这通常意味着页面是照片。
为什么处理速度很慢?
每一页都要先渲染为图片,然后逐字符读取。几页内容处理得很快;100页的扫描文档需要较长时间,而且必须保持标签页打开。
它会保留页面布局吗?
不会。列、表格和页眉会按照阅读顺序输出为普通文本行,因此复杂页面需要另外整理。
它能让PDF变得可搜索吗?
不能——这需要将不可见的文本层重新写入文件。本工具只会提供文字,方便你在其他地方使用。
免费工具·使用在浏览器中次·无需账户