PDF OCR 文字识别

识别扫描件中的文字,在保留页面原始外观的同时添加搜索功能。

选择 PDF 文件

将文件拖到此处,或使用下方按钮选择文件。

上限为 100 MB 总计 · 文件保留在您的设备上

目录章节: 12

什么时候 PDF 需要 OCR?

使用在浏览器中运行的 Tesseract,为扫描 PDF 添加可搜索文字层。请选择与原文匹配的语言;默认选择简体中文。兼容的阅读器便可搜索和选择识别出的文字,同时保留扫描页面的原始外观。

默认情况下,操作会保留已有文字的页面。也可识别每个所选页面;这会添加新文字层,可能与现有文字重复。OCR 准确性取决于清晰度、对比度、语言和页面对齐。小字、手写文字、特殊字体和噪点较多的扫描件需要仔细检查,不能自动视为可靠。

PDF 文字识别(OCR)功能

可搜索 PDF 或 TXT

将识别文字下载为纯文本,或在 PDF 中保留扫描外观并叠加文字层。

最多选择 20 页

下载结果只包含所选页面。最多选择 20 页;仅当整份文档不超过 20 页时,才可将“页面”留空以包含全文。

识别控制

选择原文语言、200 或 300 DPI、识别时的旋转方向,以及自动布局、单一文本块或稀疏文字布局。支持的语言列在下方常见问题中。

默认保留现有文字

可以保留已包含文字的页面。只有考虑过可能出现重复文字层后,才应强制重新识别。

为什么要为扫描件添加可搜索文字层?

扫描件以图片形式存储页面,普通文字搜索无法找到印在上面的内容。选择合适语言的 OCR,可以让打印文字扫描件变得可搜索,并提供可复制粘贴或供后续提取的文字。对于查找已知姓名或短语比重新设计页面更重要的档案,这尤其有用。即使扫描件看起来清楚,识别层也可能含错。使用提取文字前,请测试搜索和选择,再将姓名、参考编号和数字与页面图像比较。

哪些人会对扫描 PDF 使用 OCR?

图书馆和档案工作人员

让一份简短的印刷记录可以按标题、姓名或编号搜索。保留原始扫描件,并在下载副本中测试这些搜索词,尤其要核对容易混淆的字符。

使用扫描讲义的学生

整理学习笔记前,先让打印的课程笔记可搜索。手写批注仍可能不可靠,因此请对照扫描件核实引用段落。

日常人事管理人员

从获准使用的扫描备忘录中提取文字,用于内部索引。仔细比较日期、员工姓名和参考编号,因为识别错一个字符就可能改变标识符。

如何让扫描 PDF 变得可搜索?

  1. 选择未加密的扫描件,最多选取 20 页。下载的 PDF 只包含所选页面。如果之前没有处理过此类扫描件,请先用少量页面试做。
  2. 在“文字语言”中选择源语言。选择“可搜索 PDF”或“纯文本”,设置识别分辨率;如果扫描件需要,还可选择旋转角度或页面布局。
  3. 默认保留现有文字,或有意识地选择“识别每个所选页面”。启动 OCR 并等待识别完成。
  4. 下载结果。搜索一个已知短语,复制一行,并对照原始扫描件核实文字和数字。

选择源文件

选择使用受支持语言的扫描件,最多选取 20 页。

点击截图可放大查看。
PDF OCR 文字识别,第 1 步:选择使用受支持语言的扫描件,最多选取 20 页。

检查工具设置

选择源文件语言、OCR 输出、分辨率、布局和识别方向。

点击截图可放大查看。
PDF OCR 文字识别,第 2 步:选择源文件语言、OCR 输出、分辨率、布局和识别方向。

下载并检查结果

下载识别结果,并对照原始扫描件检查文本。

点击截图可放大查看。
PDF OCR 文字识别,第 3 步:下载识别结果,并对照原始扫描件检查文本。

截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。

让纯图像检查清单变得可搜索

源页面是一张没有可提取文字的图像。OCR 在保留页面可见外观的同时添加文字层,因此两张图看起来相同;可下载结果还包含识别文字。

处理前:纯图像页面

从源文件提取文字得到零个字符。

OCR 前的实际纯图像检查清单,没有可选择文字层。

处理后:相同页面,可搜索文字

结果包含样本的全部六行。在所测试的 1,300 像素图像尺寸下,其渲染像素与源文件一致。

实际可搜索结果 PDF,包含相同的可见检查清单和新文字层。
源文字
0 个字符
结果文字
68 个字符
识别检查
统一空白后,6 行样本文字全部匹配
查看从此结果中提取的文字
文档检查清单
请确认所有页面顺序正确
请保留原始文件的副本
分享之前核对姓名和数字
打开结果并检查文字是否清晰
本示例不包含真实个人信息

使用的设置: 第 1 页;可搜索 PDF;200 DPI 识别;单文本块;简体中文;原始方向。

这份清晰、大字号的中文样本,不是小字、手写内容、倾斜扫描件或其他语言的准确性基准。部分外部提取器可能根据文字位置插入额外空格;本工具保留识别得到的原始文字。请校对自己结果中的姓名、金额和日期。

检查日期:。使用此主题 3.14.0 版本,在本地 Chromium 浏览器中处理不含敏感信息的中文样本。这些示例仅验证所提供文件的处理结果,不代表线上主机的性能测试。 3.18.0 版缩减了此下载示例 PDF 中未使用的嵌入字体字形。页面外观和提取文字已与原始结果逐项核对一致;下载大小和校验值对应优化后的副本。

设置与输出检查

设置预期效果
支持的输入PDF
处理位置您设备上的浏览器
文件选择一个输入文件
输入大小最多 100 MB,仍受设备内存和解码页面限制约束
识别批次最多选择 20 页;可搜索 PDF 下载中只包含这些页面。

工具会添加文字层,不会将表格重建为可编辑电子表格,也不会纠正事实内容。OCR 不能替代对姓名、账号和其他高精度要求文字的审核。

检查识别方向,而不改变扫描外观

旋转设置会转动提供给识别引擎的扫描渲染图;可搜索 PDF 保留源页面的可见外观。如果希望读者看到正向页面,它不能替代“旋转 PDF”。如果现有文字层有错误,强制识别可能再加一层并产生重复搜索结果。这种情况下,纯文本 OCR 可作为经过检查的文字提取方式。请对照图像检查 0/O、1/l 和小数点等易混淆字符。

PDF 文字识别(OCR)故障排查

情况处理方法
姓名或数字有误将识别文字与图像比较。在重复使用前,请在合适的后续编辑器中修正。
原有错误 OCR 层未改善选择“识别每个所选页面”以添加新文字层。现有文字会保留,因此旧层可能产生重复搜索结果;如果需要干净的提取结果,请导出纯文本。
较长资料包被拒绝将其拆分为每组不超过 20 页,分别 OCR,并检查后再合并。

实用示例与最终检查

对于打印的检查表,请在可搜索 PDF 中搜索已知设备编号,然后将该编号和一个测量值复制到文本编辑器。对照扫描件核实两者,并确认选择高亮落在预期行上。仅成功搜索到单词,并不能证明阅读顺序正确或数字提取可靠。

常见问题

OCR 会把页面变成可编辑 Word 内容吗?

输出仍是添加了文字层的 PDF。如果需要可重排的文字文档,可之后使用“PDF 转 Word”。

提供哪些语言?

此版本包含英语、西班牙语、葡萄牙语、德语、印度尼西亚语、俄语、法语、意大利语、土耳其语、阿拉伯语、简体中文、日语、韩语、波兰语和印地语识别模型。中文界面默认为简体中文;请选择与源文件匹配的语言。OCR 识别字符,不会翻译文档。其他语言需要单独配置的 OCR 流程。

为什么某页被跳过?

默认设置会保留已有文字层的页面。选择“识别每个所选页面”,也对这些页面运行识别。

输出包含我没有选择的页面吗?

不包含。可搜索 PDF 只包含所选页面。如果需要保留完整长文档,请按每批最多 20 页进行识别,检查输出后按原顺序合并。

识别旋转会转动可见 PDF 页面吗?

不会。它旋转的是提供给识别引擎的图像,PDF 中仍保留源页面的可见外观。如果保存后的页面本身应正向显示,请先使用“旋转 PDF”。

此工具能可靠识别手写内容或重建表格吗?

工具识别所选语言的文字,不保证可靠识别手写内容,也不会重建表格单元格。请使用清晰、正向的印刷文字扫描件,并在导入 Word 或电子表格前核对文字。

相关工具与指南

继续使用 PDF 转 Word、 PDF 转文本、 扫描转 PDF。如有长期保存要求,请参阅 PDF 转 PDF/A;可搜索 PDF 并不自动等同于 PDF/A。