PDF 转 XML

将 PDF 文本项与页面几何信息提取到有明确说明的 XML 结构中。

选择 PDF 文件

将文件拖到此处,或使用下方按钮选择文件。

上限为 25 MB 总计 · 文件保留在您的设备上

目录章节: 10

XML 导出包含哪些内容?

将 PDF 的可选择文本层导出为 XML。文件按照原始页码对文本项分组,并记录页面几何信息、文本方向和定位变换,为检查和后续处理提供结构化依据。

XML 描述的是 PDF 文本阅读器提取到的内容。它不是可能曾用于生成该文档的原始 XML,也不会识别发票字段、重建表格关系或导出图片。纯图片页面需要先进行 OCR。

PDF 转 XML 功能

按页面组织的元素

将源页码、旋转角度和可见页面边界与提取文本一起保留,便于审核所选页面范围时参照。

经过转义的文本值

与号、尖括号等字符仍作为数据保留在 XML 元素内。看起来像标记的文本不会通过此导出变成可执行的页面内容。

可逆的特殊字符串

XML 无法直接表示的字符会使用明确标注的 JSON 字符串编码。接收程序可以根据该标记准确还原这些值。

浏览器内处理

在您的设备上创建 XML 文件。源文件既不会上传进行转换,也不会被重写。

如何从 PDF 提取 XML?

  1. 选择包含可选择文本的未加密 PDF。
  2. 在“页面”中输入所需页码或范围。
  3. 转换文件并下载 XML 结果。
  4. 在文本编辑器或支持 XML 的应用中打开文件。
  5. 将元素映射到其他系统之前,先对照一个已知页面和短语。

选择源 PDF

选择具有可读文本层的 PDF。

点击截图可放大查看。
PDF 转 XML:选择源 PDF。

限定页面范围

选择 XML 提取所需的页面。

点击截图可放大查看。
PDF 转 XML:页面范围与提取限制。

保存 XML

下载 XML 并检查页面元素。

点击截图可放大查看。
PDF 转 XML:下载已完成的 XML 导出文件。

截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。

为什么用 XML 检查 PDF 文本?

基于 XML 的工作流程可能需要明确的页面元素和文本项元素,才能应用自身的转换规则。团队可以检查这些元素、保留源页面引用,并针对已知文档类型建立独立映射。请区分映射与提取:文本项彼此靠近,本身并不能确立业务关系。

哪些人可以使用此 XML 输出?

集成开发者

将页面元素和文本项元素作为受控文档处理流程的输入。

文档档案管理员

检查在保留原始 PDF 的同时,文本是否仍然可用。

数据审计人员

接受转换规则之前,将输出值样本与其源页面进行比较。

设置与输出检查

设置预期结果
源文件单个 PDF,最大 25 MiB,源文档不超过 500 页。
页面范围最多选择 200 页。仅当总页数未超出此限制时,空范围才会包含所有页面。
文本限制每页最多 20,000 项,每次任务最多 100,000 项及 200 万个文本字符。
下载文件最大 64 MiB 的 XML 文档。不会获取外部 DTD 或模式文件。

检查页面后再映射已知标签

对于送货单,可先导出一页并找到熟悉的参考编号。对照原始页面,检查其文本变换和附近的文本项。随后,您的应用便可应用该文档类型的专用规则。不要在互不相关的布局中,把附近所有数字都视为同一字段。

PDF 转 XML 问题排查

情况检查事项
XML 不符合供应商的模式导出使用自己的提取结构。请另行建立映射,以满足接收系统预期的模式。
元素具有 encoding 属性如果 encoding 为 json,请将其文本解析为 JSON 字符串,以还原不能直接出现在 XML 中的字符。
文字缺失或顺序不符合预期检查是否存在扫描页面或特殊文本位置。根据需要运行 OCR,并检查坐标。

常见问题

PDF 转 XML 会恢复原始源 XML 吗?

不会。PDF 通常不保留源数据模型。此导出记录的是阅读器能够提取的文本层和几何信息。

PDF 标签会转换成 XML 文档模型吗?

不会。工具不会重建带标签 PDF 的语义、标题或表格结构。页面元素和文本项元素仅描述提取结果。

能将此 XML 转回相同的 PDF 吗?

XML 转 PDF 工具可以打印 XML 源文本,但不能根据此提取文件重建原始页面设计。请保留原始 PDF。

相关工具

XML 转 PDF, PDF 转 JSON, PDF 文字识别.