提取现有文字
读取文档中可选择的文字层,不会识别扫描图像中的字形。
将现有文本层提取到 UTF-8 文本文件。
将文件拖到此处,或使用下方按钮选择文件。
上限为 100 MB 总计 · 文件保留在您的设备上
在此预览文档。对于新添加的内容,预览仅用于辅助确定位置;请检查保存后的输出结果。
提取 PDF 现有的文字层,用于搜索、复制或进一步编辑。文本行按页面中的位置分组,尤其适合以文字为主的报告和文档档案。
输出为纯文本,不包含字体、图片或页面设计。多栏页面中的阅读顺序可能与视觉布局不同。没有文字层的扫描页面无法通过此操作转录。
读取文档中可选择的文字层,不会识别扫描图像中的字形。
使用“页面”字段,将导出限定在某一章节、信函或附录。
下载可在常见文本编辑器中打开的纯文本文件,不包含文字处理软件的排版。
相邻文字片段会组合为行。多栏阅读顺序仍需对照页面检查。
当文字比打印布局更重要时,纯文本很有用。它便于搜索本地文件夹、将内容复制到编辑器,或为记笔记准备清晰的起点,也避免把以图像为主的页面设计带入文字任务。文字层不一定与页面看起来表达的内容完全一致:连字、隐藏的 OCR 错误和栏序都可能改变导出结果。将结果用于后续工作前,请检查有代表性的段落,以及重要姓名或数字。
导出获准使用的文章文字,收集引文并整理阅读笔记。对照源页面核实每条引文,并单独记录页码。
将标准信函的文字移入文本编辑器,用于修订草稿。转入组织模板前,请检查称呼、日期和换行。
提取规格文字,整理为可搜索的工作笔记。对照 PDF 检查单位、符号和编号步骤,因为特殊字体编码可能改变提取字符。
选择已有可选择文本层的 PDF。
点击截图可放大查看。
选择页面,并按需设置下载文件名。
点击截图可放大查看。
下载 TXT 文件,对照 PDF 核验文字内容。
点击截图可放大查看。
截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。
| 设置 | 预期效果 |
|---|---|
| 支持的输入 | |
| 处理位置 | 您的浏览器 |
| 文件选择 | 一个输入文件 |
| 输入大小 | 总计 100 MB;解码后的图像和页面也有像素限制 |
| 页面选择 | 每次任务最多选择 200 页。只有 PDF 不超过 200 页时,“页面”留空才表示所有页面;更长文档请分范围处理。 |
如果页面是扫描件,无法选择文字,请先添加并检查 OCR 文字层,再使用文字提取。
文字片段在 PDF 中的存储顺序可能与可见位置不同。侧栏、脚注和双栏布局经常导致导出句子被打断。可见字形也可能依赖字体映射,提取时不一定能得到同一个字符。将 TXT 视为可靠源文字前,请对照跨栏或跨页的段落,并检查技术符号和“fi”等连字。
| 情况 | 处理方法 |
|---|---|
| 文本文件为空,或转换被拒绝 | 所选页面可能没有文字层。条件允许时,请先使用 OCR。 |
| 部分文字不正确 | PDF 的文字编码或 OCR 层可能存在问题。请将姓名、数字和符号与可见页面比较。 |
| 需要带格式的可编辑文档 | 使用“PDF 转 Word”生成 DOCX 初稿;精确布局仍需检查。 |
假设左列是 A1, A2,右列是 B1, B2。按位置分组可能得到 A1 B1,下一行是 A2 B2,从而混合两列。重新排列提取的行之前,先阅读 PDF 中的每一列;看起来整齐的文本文件也可能把无关句子连在一起。
请先运行 OCR 添加识别文字。选择纯图像源文件时,会显示明确的无文字提示。
基于位置的行分组会近似还原行序。段落分隔和复杂分栏需要人工编辑检查。
所选页面的文字以空行连接。如果需要精确引用回原 PDF,请在笔记中保留实际页面范围。
继续使用 PDF 文字识别(OCR)、 PDF 阅读器。如需其他语言的输出,请阅读 PDF 翻译流程;文字提取本身不会翻译。