PDF 转 JSON

将可选择的文本、页面几何信息和文本位置导出为 JSON。

选择 PDF 文件

将文件拖到此处,或使用下方按钮选择文件。

上限为 25 MB 总计 · 文件保留在您的设备上

目录章节: 10

可以从 PDF 中提取哪些内容到 JSON?

将 PDF 的文本层转换为 JSON 文件,便于检查或进一步处理。导出内容记录所选页面、页面尺寸,以及 PDF 阅读器返回的文本项,包括它们的位置和变换信息。

PDF 存储的是页面显示指令。本工具不会推断发票字段、重建表格或识别原始标题层级。扫描页面需要先进行 OCR 文字识别,其中的文字才能出现在导出结果中。

PDF 转 JSON 功能

页面选择

导出指定页面范围,同时保留原始页码。处理较长文档前,先检查小样本会更方便。

带坐标的文本

将文本项与页面几何信息和定位信息一同保留。请参照原始 PDF 解读坐标,并核实各项在视觉上的关系。

机器可读的输出

下载有效的 JSON,用于您自己的解析器或审核流程。导出的文本会作为数据进行转义;工具不会执行文档内容。

本地处理

在浏览器中读取所选 PDF。文档不会发送到转换服务器,原始文件也不会被修改。

如何将 PDF 文本转换为 JSON?

  1. 选择一个未加密且能在阅读器中选择文本的 PDF。
  2. 输入 1, 3-5 等页码,或将“页面”留空,以包含所有符合限制的页面。
  3. 开始转换并下载 JSON 文件。
  4. 在 JSON 查看器或编辑器中打开文件,将熟悉的短语与对应 PDF 页面进行比较。
  5. 将数据用于其他应用前,请检查坐标、阅读顺序以及是否存在空白页面。

选择 PDF

选择包含可选择文本的 PDF。

点击截图可放大查看。
PDF 转 JSON:选择带有文本层的示例 PDF。

选择页面

设置页面范围并查看提取限制。

点击截图可放大查看。
PDF 转 JSON:页面选择与提取设置。

下载 JSON

保存 JSON,并与源页面进行比较。

点击截图可放大查看。
PDF 转 JSON:下载已完成的结构化文本导出文件。

截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。

为什么将 PDF 文本导出为 JSON?

当文档工作流程同时需要文本和位置信息时,JSON 很有用。开发者可以检查提取质量、查找重复标签,或准备独立的映射流程。请明确定义映射规则:附近的金额不会自动成为发票总额,提取顺序也不保证与人的阅读顺序一致。

哪些人可以使用此导出功能?

文档处理开发者

构建解析器之前检查文本层,并保留页面引用以便调试。

数据审核团队

采纳提取规则之前,将抽样值与源页面进行比较。

学生与研究人员

了解固定布局文档中的可见文本是如何表示的。

设置与输出检查

设置预期结果
输入单个 PDF,最大 25 MiB;源文档最多 500 页。
选择范围最多选择 200 页;每页最多 20,000 个文本项,每次任务最多 100,000 项及 200 万个文本字符。
输出包含提取文本和几何信息的 JSON;最大 64 MiB。
扫描页面不执行自动 OCR、图片导出或文档字段识别。

构建解析器之前先检查小样本

对于双栏账单,请先导出一页。找到熟悉的标签,并将其位置与打印出的数值进行比较。如果两栏的文本项交错出现,应在您自己的代码中依据坐标分组,不要假设数组已经是整理好的表格。

PDF 转 JSON 问题排查

情况检查事项
找不到可选择的文本对扫描页面运行 OCR,然后导出生成的 PDF 文本层。
文本顺序不符合预期对照页面与文本位置;提取顺序并不等于阅读顺序。
选择范围过大而被拒绝减少所选页面。内容密集的页面可能先达到文本项上限,再达到页数上限。

常见问题

PDF 转 JSON 会识别发票字段吗?

不会。结果包含文本项和几何信息。字段名称、字段关系和业务校验需要独立的映射流程。

是否包含图片和表格?

不会导出图片。可以提取表格中的文字,但不会重建行列关系。

可以用此 JSON 重建原始 PDF 吗?

此导出格式用于检查,并不是 PDF 的完整表示。请保留原始 PDF,以保存外观、图形、字体和交互功能。

相关工具

JSON 转 PDF, PDF 转 XML, PDF 文字识别.