带引号的文本标量
将 yes 等单词、日期、标点和含冒号的短语保留为字符串值。提取文本不会成为 YAML 指令或自定义对象标签。
将 PDF 文本项及其页面位置导出为 YAML 数据。
将文件拖到此处,或使用下方按钮选择文件。
上限为 25 MB 总计 · 文件保留在您的设备上
在此预览文档。对于新添加的内容,预览仅用于辅助确定位置;请检查保存后的输出结果。
创建包含所选 PDF 页面提取文本项的 YAML 文件。结果包含源页面引用、页面几何信息和文本位置变换,适合在文本编辑器中检查,或供独立处理流程使用。
导出不会将文档解释为应用配置。它无法推断标题层级、提取图片、识别发票字段或根据外观重建表格。文本遵循 PDF 阅读器的提取顺序,这可能与阅读顺序不同。
将 yes 等单词、日期、标点和含冒号的短语保留为字符串值。提取文本不会成为 YAML 指令或自定义对象标签。
所选页面保留源页码。审核人员无需计算输出数组中的位置,即可返回对应 PDF 页面。
将文本变换、方向和页面尺寸与文字一同保存。后续流程可以检查位置,而不必假定结果已经是整理好的表格。
输出明确声明未进行语义重建或 OCR,便于其他程序将结果作为提取依据处理。
选择包含需要检查文本的 PDF。
点击截图可放大查看。
先从少量源页面开始。
点击截图可放大查看。
保存输出并检查带引号的文本值。
点击截图可放大查看。
截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。
当团队希望在无需独立查看器的情况下获取结构化页面信息时,YAML 可方便文本审核。请将导出视为文档数据,并在导入前进行自己的验证。PDF 账单中的文字仅仅被存入 YAML 文件,并不意味着它应成为可信的配置。
为已知文档布局设计提取规则之前,先检查文本与页面引用。
在核对选定引文及页面位置时,保留可读的中间记录。
使用可处理结构化文本文件的工具,比较提取文档数据的变化。
| 设置 | 预期结果 |
|---|---|
| 输入文件 | 单个 PDF,最大 25 MiB,源文档最多 500 页。 |
| 所选页面 | 按输入顺序最多选择 200 页;重复的页面引用只出现一次。 |
| 提取上限 | 每页 20,000 项,每次任务 100,000 项及 200 万个文本字符。 |
| YAML 输出 | 声明为 YAML 1.2,使用带引号的字符串值;下载文件最大 64 MiB。 |
表单可能在标签旁印有 yes 一词,以及带前导零的数字。请在 YAML 中检查这些提取字符串,并与源文件比较。导出将文本保留为带引号的值,让您自己的应用决定某个值是标签、标识符、日期还是其他内容。
| 情况 | 检查事项 |
|---|---|
| 文本包含 Unicode 转义序列 | YAML 解析器可以从带引号的转义序列还原原始字符。这也能避免控制字符破坏文件结构。 |
| 输出不是可直接导入的配置 | 这是提取记录。请单独映射并验证应用所需的字段。 |
| 选择内容过于密集 | 缩小页面范围。密集页面可能先达到文本项或字符上限,再达到页数上限。 |
不会。它读取 PDF 并创建 YAML 输出,不会加载上传的 YAML、执行标签或应用配置设置。
不会自动执行 OCR。请先对纯图片 PDF 进行 OCR,然后检查识别文本,再进行导出。
不一定。多栏页面和定位标签可能产生不同的提取顺序。请检查坐标并对照原始页面。