PDF工具 / 09
PDF 转文本
逐页提取 PDF 中可选中的文本,整个过程都在浏览器中完成。
PDF 转文本: TOEA读取PDF每页存储的定位文本片段,并将它们重新分组成文本行,同时标记每一页,让输出内容便于浏览。 完全在浏览器中本地运行,文件不会上传到服务器。
- 类别
- PDF工具
- 使用次数
- 在浏览器中
- 费用
- 免费·无需注册
- 可用性
- 可直接使用
完全在浏览器中运行
PDF · 最大60 MB,不会上传
文本提取结果乱码时
有时提取功能确实返回了文本,但内容是错误的:可能出现随机符号、方框,或沿字母表偏移的字母。这是因为PDF中的字体没有将字形映射回真实字符的对应表,而某些设计和印刷软件会省略这部分信息。页面看起来正常,是因为软件绘制的是图形;底层字符却不是页面上显示的字母。请将此文件视为扫描件,并使用扫描PDF转文本处理。
较轻微的异常通常有更简单的原因:fi和fl被合并为单个连字字符,或者因为PDF分别放置每个字母,导致一个单词被拆成两部分。
整理提取的文本
打印行会被提取为单独的行,因此段落每隔几个词就会出现换行,行末带连字符的单词也会保持拆分状态。页眉、页脚和页码会在正文中每页重复一次。在引用或重新使用文本前,请先清除这些内容;如果文本要作为一个整体使用,也请删除页面标签。
要统计文档中的单词或字符数,请将清理后的文本粘贴到字数统计中;直接从原始提取结果统计,会把所有页眉和标签也计算进去。
使用方法
- 选择一个 PDF 文件。
- 提取文本。
- 复制文本或下载 .txt 文件。
隐私与限制
文件会在浏览器中打开并重新处理,绝不会上传;当文档是合同、扫描件或其他你不会交给陌生人的内容时,这一点尤其重要。扫描版PDF不包含可提取的文本,工具会明确报告这一情况,而不是返回一个空文件。
相关工具
常见问题
为什么我的 PDF 没有生成任何内容?
它几乎肯定是扫描图片。页面照片本身不包含文本,恢复文本需要OCR,而此工具不提供OCR功能。
为什么版式不一样了?
PDF以定位的文本片段存储内容,而不是按段落存储。工具会根据位置将文本片段重新组合成行,但列和表格无法保持原来的样子。
会标记分页吗?
会。输出中会标记每一页,因此你可以看出页面在哪里结束。
受保护的文件可以处理吗?
受密码保护的文档无法打开。请先移除密码。
免费工具·使用在浏览器中次·无需账户