可搜索 PDF 或 TXT
将识别文字下载为纯文本,或在 PDF 中保留扫描外观并叠加文字层。
识别扫描件中的文字,在保留页面原始外观的同时添加搜索功能。
将文件拖到此处,或使用下方按钮选择文件。
上限为 100 MB 总计 · 文件保留在您的设备上
在此预览文档。对于新添加的内容,预览仅用于辅助确定位置;请检查保存后的输出结果。
使用在浏览器中运行的 Tesseract,为扫描 PDF 添加可搜索文字层。请选择与原文匹配的语言;默认选择简体中文。兼容的阅读器便可搜索和选择识别出的文字,同时保留扫描页面的原始外观。
默认情况下,操作会保留已有文字的页面。也可识别每个所选页面;这会添加新文字层,可能与现有文字重复。OCR 准确性取决于清晰度、对比度、语言和页面对齐。小字、手写文字、特殊字体和噪点较多的扫描件需要仔细检查,不能自动视为可靠。
将识别文字下载为纯文本,或在 PDF 中保留扫描外观并叠加文字层。
下载结果只包含所选页面。最多选择 20 页;仅当整份文档不超过 20 页时,才可将“页面”留空以包含全文。
选择原文语言、200 或 300 DPI、识别时的旋转方向,以及自动布局、单一文本块或稀疏文字布局。支持的语言列在下方常见问题中。
可以保留已包含文字的页面。只有考虑过可能出现重复文字层后,才应强制重新识别。
扫描件以图片形式存储页面,普通文字搜索无法找到印在上面的内容。选择合适语言的 OCR,可以让打印文字扫描件变得可搜索,并提供可复制粘贴或供后续提取的文字。对于查找已知姓名或短语比重新设计页面更重要的档案,这尤其有用。即使扫描件看起来清楚,识别层也可能含错。使用提取文字前,请测试搜索和选择,再将姓名、参考编号和数字与页面图像比较。
让一份简短的印刷记录可以按标题、姓名或编号搜索。保留原始扫描件,并在下载副本中测试这些搜索词,尤其要核对容易混淆的字符。
整理学习笔记前,先让打印的课程笔记可搜索。手写批注仍可能不可靠,因此请对照扫描件核实引用段落。
从获准使用的扫描备忘录中提取文字,用于内部索引。仔细比较日期、员工姓名和参考编号,因为识别错一个字符就可能改变标识符。
选择使用受支持语言的扫描件,最多选取 20 页。
点击截图可放大查看。
选择源文件语言、OCR 输出、分辨率、布局和识别方向。
点击截图可放大查看。
下载识别结果,并对照原始扫描件检查文本。
点击截图可放大查看。
截图展示了使用不含敏感信息的示例文件操作本工具箱的过程。您的文件名、页数和设置可能不同。
源页面是一张没有可提取文字的图像。OCR 在保留页面可见外观的同时添加文字层,因此两张图看起来相同;可下载结果还包含识别文字。
文档检查清单 请确认所有页面顺序正确 请保留原始文件的副本 分享之前核对姓名和数字 打开结果并检查文字是否清晰 本示例不包含真实个人信息
使用的设置: 第 1 页;可搜索 PDF;200 DPI 识别;单文本块;简体中文;原始方向。
这份清晰、大字号的中文样本,不是小字、手写内容、倾斜扫描件或其他语言的准确性基准。部分外部提取器可能根据文字位置插入额外空格;本工具保留识别得到的原始文字。请校对自己结果中的姓名、金额和日期。
检查日期:。使用此主题 3.14.0 版本,在本地 Chromium 浏览器中处理不含敏感信息的中文样本。这些示例仅验证所提供文件的处理结果,不代表线上主机的性能测试。 3.18.0 版缩减了此下载示例 PDF 中未使用的嵌入字体字形。页面外观和提取文字已与原始结果逐项核对一致;下载大小和校验值对应优化后的副本。
| 设置 | 预期效果 |
|---|---|
| 支持的输入 | |
| 处理位置 | 您设备上的浏览器 |
| 文件选择 | 一个输入文件 |
| 输入大小 | 最多 100 MB,仍受设备内存和解码页面限制约束 |
| 识别批次 | 最多选择 20 页;可搜索 PDF 下载中只包含这些页面。 |
工具会添加文字层,不会将表格重建为可编辑电子表格,也不会纠正事实内容。OCR 不能替代对姓名、账号和其他高精度要求文字的审核。
旋转设置会转动提供给识别引擎的扫描渲染图;可搜索 PDF 保留源页面的可见外观。如果希望读者看到正向页面,它不能替代“旋转 PDF”。如果现有文字层有错误,强制识别可能再加一层并产生重复搜索结果。这种情况下,纯文本 OCR 可作为经过检查的文字提取方式。请对照图像检查 0/O、1/l 和小数点等易混淆字符。
| 情况 | 处理方法 |
|---|---|
| 姓名或数字有误 | 将识别文字与图像比较。在重复使用前,请在合适的后续编辑器中修正。 |
| 原有错误 OCR 层未改善 | 选择“识别每个所选页面”以添加新文字层。现有文字会保留,因此旧层可能产生重复搜索结果;如果需要干净的提取结果,请导出纯文本。 |
| 较长资料包被拒绝 | 将其拆分为每组不超过 20 页,分别 OCR,并检查后再合并。 |
对于打印的检查表,请在可搜索 PDF 中搜索已知设备编号,然后将该编号和一个测量值复制到文本编辑器。对照扫描件核实两者,并确认选择高亮落在预期行上。仅成功搜索到单词,并不能证明阅读顺序正确或数字提取可靠。
输出仍是添加了文字层的 PDF。如果需要可重排的文字文档,可之后使用“PDF 转 Word”。
此版本包含英语、西班牙语、葡萄牙语、德语、印度尼西亚语、俄语、法语、意大利语、土耳其语、阿拉伯语、简体中文、日语、韩语、波兰语和印地语识别模型。中文界面默认为简体中文;请选择与源文件匹配的语言。OCR 识别字符,不会翻译文档。其他语言需要单独配置的 OCR 流程。
默认设置会保留已有文字层的页面。选择“识别每个所选页面”,也对这些页面运行识别。
不包含。可搜索 PDF 只包含所选页面。如果需要保留完整长文档,请按每批最多 20 页进行识别,检查输出后按原顺序合并。
不会。它旋转的是提供给识别引擎的图像,PDF 中仍保留源页面的可见外观。如果保存后的页面本身应正向显示,请先使用“旋转 PDF”。
工具识别所选语言的文字,不保证可靠识别手写内容,也不会重建表格单元格。请使用清晰、正向的印刷文字扫描件,并在导入 Word 或电子表格前核对文字。
继续使用 PDF 转 Word、 PDF 转文本、 扫描转 PDF。如有长期保存要求,请参阅 PDF 转 PDF/A;可搜索 PDF 并不自动等同于 PDF/A。