PDF 转 YAML

将 PDF 文本项及其页面位置导出为 YAML 数据。

选择 PDF 文件

将文件拖到此处,或使用下方按钮选择文件。

上限为 25 MB 总计 · 文件保留在您的设备上

目录章节: 10

PDF 转 YAML 能导出哪些内容?

创建包含所选 PDF 页面提取文本项的 YAML 文件。结果包含源页面引用、页面几何信息和文本位置变换,适合在文本编辑器中检查,或供独立处理流程使用。

导出不会将文档解释为应用配置。它无法推断标题层级、提取图片、识别发票字段或根据外观重建表格。文本遵循 PDF 阅读器的提取顺序,这可能与阅读顺序不同。

PDF 转 YAML 功能

带引号的文本标量

将 yes 等单词、日期、标点和含冒号的短语保留为字符串值。提取文本不会成为 YAML 指令或自定义对象标签。

原始页面引用

所选页面保留源页码。审核人员无需计算输出数组中的位置,即可返回对应 PDF 页面。

文本几何信息

将文本变换、方向和页面尺寸与文字一同保存。后续流程可以检查位置,而不必假定结果已经是整理好的表格。

明确的提取范围

输出明确声明未进行语义重建或 OCR,便于其他程序将结果作为提取依据处理。

如何将 PDF 文本转换为 YAML?

  1. 选择一个包含可选择文本的未加密 PDF。
  2. 输入较小的页面范围;如果整份文档未超过选择限制,也可将“页面”留空。
  3. 开始转换并保存 .yaml 文件。
  4. 在支持 YAML 的编辑器中打开输出,检查页面和文本项条目。
  5. 将重要字符串及其位置用于其他流程前,请先与原始 PDF 比较。

选择 PDF

选择包含需要检查文本的 PDF。

点击截图可放大查看。
PDF 转 YAML:选择示例 PDF。

选择提取范围

先从少量源页面开始。

点击截图可放大查看。
PDF 转 YAML:选择要进行结构化导出的页面。

下载 YAML

保存输出并检查带引号的文本值。

点击截图可放大查看。
PDF 转 YAML:下载已完成的结构化数据。

截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。

为什么将 PDF 文本导出为 YAML?

当团队希望在无需独立查看器的情况下获取结构化页面信息时,YAML 可方便文本审核。请将导出视为文档数据,并在导入前进行自己的验证。PDF 账单中的文字仅仅被存入 YAML 文件,并不意味着它应成为可信的配置。

哪些人可以使用 YAML 提取?

自动化开发者

为已知文档布局设计提取规则之前,先检查文本与页面引用。

研究团队

在核对选定引文及页面位置时,保留可读的中间记录。

技术审核人员

使用可处理结构化文本文件的工具,比较提取文档数据的变化。

设置与输出检查

设置预期结果
输入文件单个 PDF,最大 25 MiB,源文档最多 500 页。
所选页面按输入顺序最多选择 200 页;重复的页面引用只出现一次。
提取上限每页 20,000 项,每次任务 100,000 项及 200 万个文本字符。
YAML 输出声明为 YAML 1.2,使用带引号的字符串值;下载文件最大 64 MiB。

将打印值保留为文本

表单可能在标签旁印有 yes 一词,以及带前导零的数字。请在 YAML 中检查这些提取字符串,并与源文件比较。导出将文本保留为带引号的值,让您自己的应用决定某个值是标签、标识符、日期还是其他内容。

PDF 转 YAML 问题排查

情况检查事项
文本包含 Unicode 转义序列YAML 解析器可以从带引号的转义序列还原原始字符。这也能避免控制字符破坏文件结构。
输出不是可直接导入的配置这是提取记录。请单独映射并验证应用所需的字段。
选择内容过于密集缩小页面范围。密集页面可能先达到文本项或字符上限,再达到页数上限。

常见问题

此工具会读取或执行 YAML 输入吗?

不会。它读取 PDF 并创建 YAML 输出,不会加载上传的 YAML、执行标签或应用配置设置。

会识别扫描页面中的文字吗?

不会自动执行 OCR。请先对纯图片 PDF 进行 OCR,然后检查识别文本,再进行导出。

提取的文本项已经按阅读顺序排列了吗?

不一定。多栏页面和定位标签可能产生不同的提取顺序。请检查坐标并对照原始页面。

相关工具

PDF 转 JSON, PDF 转 XML, PDF 文字识别.