仅比较两个文档
选择两个需要检查文字的 PDF。工具支持每个文档最多 200 页,并按实际位置配对页面。
逐页比较两个 PDF 提取出的文本。
将文件拖到此处,或使用下方按钮选择文件。
上限为 100 MB 总计 · 文件保留在您的设备上
在此预览文档。对于新添加的内容,预览仅用于辅助确定位置;请检查保存后的输出结果。
比较两个 PDF 中相同页面位置提取出的文本。输出是 HTML 报告,将两个文档中每页的文字并排显示,并标明这些文本字符串是否不同。它有助于定位以文本为基础的草稿修订中的变化。
比较按照实际页面位置进行。在文档开头附近插入一页,可能让后续页面对都出现差异,即使文字只是移动了位置。报告不会尝试语义对齐、逐词高亮、图片比较或视觉布局分析。
选择两个需要检查文字的 PDF。工具支持每个文档最多 200 页,并按实际位置配对页面。
可下载的 HTML 报告会在每个位置显示两个文件提取出的文本,并将页面对标记为文本相同或文本不同。
差异位置计数有助于找出需要检查的页面。它不提供逐词高亮,也不会自动解释变化。
如果两个文件都没有可用文本,比较会被拒绝。扫描件可能需要 OCR,而图片、签名和布局仍需目视检查。
只选择两个 PDF 版本,原版在前,修订版在后。
点击截图可放大查看。
检查页面是否对应以及文本层是否可用,然后运行文本比较。
点击截图可放大查看。
打开下载的 HTML 报告,对照源 PDF 检查每组有差异的页面。
点击截图可放大查看。
截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。
只有工作坊标记发生变化:蓝绿色圆形变成红色正方形。实际文本比较报告发现,文本不同的页面位置为零。
使用的设置: 按相同页面位置比较两份完整的单页 PDF。
文本比较不能证明视觉内容相同。请打开两份 PDF,检查标记、颜色及布局。
检查日期:。无敏感信息的原创样本在本地 Chromium 中使用 3.16.0 版本处理;这不是生产托管环境的性能测试。
| 设置 | 预期情况 |
|---|---|
| 接受的输入 | |
| 处理位置 | 您的浏览器 |
| 文件选择 | 仅限两个 PDF;每个最多 200 页 |
| 输入大小 | 总计 100 MB;解码后的图片和页面还受像素数量限制 |
| 比较长度 | 两个源 PDF 各自最多可包含 200 页。 |
两个纯图片扫描件可能具有空文本层,即使图片不同,文本上也会看似相同。如果两个文件都无法提取可用文本,报告会拒绝比较。OCR 可为扫描件准备文本,但识别差异也可能被误认为内容修改。
如果文本文件的两个版本分页相近,且您需要定位提取文字有差异的页面,比较功能就很有用。页面级报告缩小了人工检查范围,并排文本有助于您自行检查原始和修订后的措辞。
编辑可以比较两份分页相近的公开通知,找到措辞发生变化的页面。应阅读整张变化页面,而不要把差异标签当成修改内容的摘要。
学生可以在修订后检查项目报告的导出版本。如果新增段落改变了分页,应比较对应节选,而不要假设报告中的所有差异都是新文字。
作者可以检查两个获准使用的培训讲义版本,定位修改过的说明。对照源文件确认提取文字,并单独检查表格或示意图,因为文本报告不能证明视觉上等同。
| 情况 | 处理方法 |
|---|---|
| 添加一页后,许多页面都不同 | 先让文档章节对应,或比较相匹配的节选。 |
| 扫描件无法得到有用的比较结果 | 两个文件都需要可读文本层。如果有 OCR 工具,请先对扫描件进行 OCR。 |
| 空格导致了意外差异 | 不同 PDF 的文本提取结果可能不同。应检查显示的措辞,不要把每处差异都视为实质性修改。 |
对于三页通知的两个版本,先确认对应章节位于相同位置。如果只有第 2 页提取的文本发生变化,报告应将该位置标记为不同。阅读该页两个版本的完整内容,并检查源 PDF。其他位置标记为文本相同,并不能证明它们的标志、签名或布局没有变化。
不能。它比较的是提取的文本。请目视检查 PDF 中照片、示意图和格式的变化。
会。文本按相同页面位置比较,因此分页变化会影响报告。
不能。文件可以包含相同的提取文本,但在图片、元数据、批注和布局方面不同。
继续使用 PDF 转文本, PDF OCR 文字识别, PDF 阅读器。