Распознать текст в PDF (OCR)

Сделайте сканы доступными для поиска, сохранив исходный вид страниц.

Выберите файлы PDF

Перетащите файлы сюда или используйте кнопку ниже.

До 100 МБ всего · Файлы остаются на вашем устройстве

СодержаниеРазделов: 12

Когда PDF нужно распознавание текста?

Добавьте текстовый слой с возможностью поиска в отсканированный PDF с помощью Tesseract, работающего в браузере. Выберите язык оригинала; по умолчанию выбран русский. Совместимые программы просмотра смогут искать и выделять распознанные слова, а отсканированная страница сохранит исходный вид.

По умолчанию операция сохраняет страницы, на которых уже есть текст. Можно также распознать каждую выбранную страницу; это добавляет новый слой и может продублировать существующий текст. Точность OCR зависит от резкости, контрастности, языка и ориентации страницы. Мелкий шрифт, рукописный текст, необычные гарнитуры и сканы с помехами требуют тщательной проверки, а не автоматического доверия.

Возможности распознавания текста PDF

PDF с возможностью поиска или TXT

Скачайте распознанные формулировки как обычный текст или добавьте текстовый слой поверх сохранённого внешнего вида скана в PDF.

До 20 выбранных страниц

Скачанный документ содержит только выбранные страницы. Выберите до 20 страниц; оставляйте поле «Страницы» пустым для всего документа только тогда, когда в нём не более 20 страниц.

Настройки распознавания

Выберите язык оригинала, 200 или 300 DPI, поворот для распознавания и режим разметки: автоматический, единый блок или разреженный текст. Поддерживаемые языки перечислены в разделе вопросов ниже.

Сохранение существующего текста по умолчанию

Страницы, уже содержащие текст, можно сохранить. Принудительно запускайте распознавание только после оценки возможного дублирования текстовых слоёв.

Зачем добавлять в скан текстовый слой с возможностью поиска?

Скан хранит страницу как картинку, поэтому обычный поиск текста не находит напечатанные на ней слова. OCR на выбранном языке может сделать скан печатного текста доступным для поиска и предоставить текст для копирования и вставки или последующего извлечения. Это особенно полезно для архивов, где найти известное имя или фразу важнее, чем изменить оформление страницы. Распознанный слой может содержать ошибки, даже если скан выглядит чётким. Проверьте поиск и выделение, затем сравните имена, ссылки и числа с изображением страницы перед использованием извлечённого текста.

Кто использует OCR для сканов PDF?

Сотрудники библиотек и архивов

Сделайте короткий печатный документ доступным для поиска по заголовку, имени или номеру документа. Сохраните исходный скан и проверьте эти поисковые слова в скачанной копии, включая легко путаемые символы.

Студенты с отсканированными учебными материалами

Сделайте печатные материалы курса доступными для поиска, прежде чем составлять учебные заметки. Рукописные пометки могут оставаться ненадёжно распознанными, поэтому сверяйте цитируемые отрывки со сканом.

Сотрудники текущего кадрового делопроизводства

Извлеките текст из разрешённой отсканированной служебной записки для внутреннего указателя. Тщательно сравните даты, имена сотрудников и регистрационные номера: один распознанный символ может изменить идентификатор.

Как сделать отсканированный PDF доступным для поиска?

  1. Выберите незашифрованный скан и не более 20 страниц. Скачанный PDF содержит только выбранные страницы. Начните с короткого образца, если ещё не работали с таким типом скана.
  2. Выберите язык исходника в поле «Язык текста». Выберите «PDF с возможностью поиска» или «Обычный текст (.txt)», задайте разрешение распознавания и при необходимости выберите поворот или макет страницы.
  3. По умолчанию сохраняйте существующий текст или осознанно выберите «Распознать все выбранные страницы». Запустите OCR и дождитесь завершения распознавания.
  4. Скачайте результат. Найдите известную фразу, скопируйте строку и сравните написание слов и числа с исходным сканом.

Выберите исходный файл

Выберите скан на поддерживаемом языке и не более 20 страниц.

Нажмите на снимок экрана, чтобы увеличить его.
Распознать текст в PDF (OCR), шаг 1: Выберите скан на поддерживаемом языке и не более 20 страниц.

Проверьте настройки инструмента

Выберите язык источника, результат OCR, разрешение, разметку и ориентацию распознавания.

Нажмите на снимок экрана, чтобы увеличить его.
Распознать текст в PDF (OCR), шаг 2: Выберите язык источника, результат OCR, разрешение, разметку и ориентацию распознавания.

Скачайте и проверьте результат

Скачайте результат и сравните распознанный текст с исходным сканом.

Нажмите на снимок экрана, чтобы увеличить его.
Распознать текст в PDF (OCR), шаг 3: Скачайте результат и сравните распознанный текст с исходным сканом.

Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.

Контрольный список в виде изображения становится доступным для поиска

Исходная страница является изображением без извлекаемого текста. OCR добавляет текстовый слой, сохраняя вид страницы. Поэтому оба изображения выглядят одинаково; скачиваемый результат также содержит распознанные слова.

До: страница только в виде изображения

Извлечение текста из исходника вернуло ноль символов.

Настоящий контрольный список в виде изображения до OCR, без выделяемого текстового слоя.

После: та же страница, текст доступен для поиска

Результат содержит все шесть строк образца. Пиксели сформированного изображения совпадают с исходником при проверенном размере изображения 1 300 пикселей.

Настоящий результирующий PDF с возможностью поиска, тем же видимым контрольным списком и новым текстовым слоем.
Исходный текст
0 символов
Текст результата
214 символов
Проверка распознавания
6 из 6 строк примера (пробелы нормализованы)
Прочитать текст, извлечённый из результата
СПИСОК ДЛЯ СЕМИНАРА 
Подтвердите бронирование помещения. 
Распечатайте сорок копий материалов. 
Проверьте проектор до 09:00. 
Сохраните окончательный список участников. 
Это безобидный пример распознавания текста.

Использованные настройки: Страница 1; PDF с поиском по тексту; русский язык; распознавание при 200 DPI; один блок текста; исходная ориентация.

Этот чёткий русскоязычный образец с крупным шрифтом не является эталоном точности для мелкого шрифта, рукописного текста, наклонных сканов или других языков. Проверьте имена, суммы и даты в собственном результате.

Проверено . Безобидные файлы примеров обработаны в русской версии темы 3.9.0 с помощью локального браузера Chromium. Эти примеры не служат показателем производительности рабочего хостинга.

Настройки и проверка результата

НастройкаЧего ожидать
Поддерживаемые входные данныеPDF
Место обработкиВ вашем браузере, на вашем устройстве
Выбор файловОдин исходный файл
Размер исходных данныхДо 100 МБ с учётом памяти устройства и ограничений декодированных страниц
Пакет распознаванияДо 20 выбранных страниц; только они входят в скачанный PDF с возможностью поиска.

Инструмент добавляет текстовый слой; он не восстанавливает таблицы как редактируемую электронную таблицу и не исправляет фактическое содержание. OCR не заменяет проверку имён, номеров счетов и другого текста, требующего точности.

Проверьте ориентацию распознавания, не меняя скан

Настройка поворота разворачивает изображение скана, передаваемое на распознавание; PDF с возможностью поиска сохраняет вид исходной страницы. Это не замена инструменту «Повернуть PDF», если читатели должны видеть страницу в правильной ориентации. Если существующий текстовый слой содержит ошибки, принудительное распознавание может добавить ещё один слой и дать повторяющиеся результаты поиска. В такой ситуации OCR в обычный текст может быть полезным способом получить проверенное извлечение. Сравнивайте с изображением легко путаемые символы, например 0/O, 1/l и десятичные точки.

Решение проблем при распознавании текста PDF

СитуацияЧто делать
Имя или число распознано неверноСравните распознанный текст с изображением. Перед повторным использованием исправьте его в подходящем редакторе на следующем этапе.
Существующий неверный слой OCR не улучшилсяВыберите «Распознать все выбранные страницы», чтобы добавить новый слой. Существующий текст сохраняется, поэтому имеющийся слой может давать повторяющиеся результаты поиска; экспортируйте обычный текст, если нужно чистое извлечение.
Большой комплект документов отклоняетсяРазделите его на группы по 20 страниц или меньше, распознайте каждую группу и проверьте их перед объединением.

Практический пример и итоговая проверка

Для печатного листа осмотра найдите известный идентификатор оборудования в PDF с возможностью поиска, затем скопируйте этот идентификатор и одно измерение в текстовый редактор. Сравните оба значения со сканом и убедитесь, что выделяется нужная строка. Один успешный поиск слова не доказывает правильный порядок чтения или надёжное извлечение чисел.

Частые вопросы

Превращает ли OCR страницу в редактируемое содержимое Word?

Результат остаётся PDF с добавленным текстовым слоем. Если нужен текстовый документ с изменяемым расположением текста, затем используйте «PDF в Word».

Какие языки доступны?

В этот выпуск входят модели распознавания русского, английского, испанского, португальского, немецкого, индонезийского, французского, итальянского, турецкого, арабского, упрощённого китайского, японского, корейского, польского и хинди языков. По умолчанию выбран русский; выбирайте язык, соответствующий исходнику. OCR распознаёт символы, но не переводит документ. Для других языков нужен отдельно настроенный способ OCR.

Почему страница была пропущена?

Настройка по умолчанию сохраняет страницы с существующим текстовым слоем. Выберите «Распознать все выбранные страницы», чтобы выполнить распознавание и для них.

Включает ли результат страницы, которые я не выбрал?

Нет. PDF с возможностью поиска содержит только выбранные страницы. Чтобы сохранить длинный документ целиком, распознавайте группы до 20 страниц и объединяйте проверенные результаты в исходном порядке.

Повернёт ли поворот для распознавания видимую страницу PDF?

Нет. Он поворачивает изображение, передаваемое на распознавание, сохраняя вид исходной страницы в PDF. Сначала используйте «Повернуть PDF», если сама сохранённая страница должна отображаться в правильной ориентации.

Может ли этот инструмент надёжно читать рукописный текст или восстанавливать таблицы?

Инструмент распознаёт текст на выбранном языке, но не обещает надёжного распознавания рукописей и не восстанавливает ячейки таблиц. Используйте чёткий, правильно ориентированный скан печатного текста и проверьте слова перед переносом в Word или электронную таблицу.

Связанные инструменты и руководства

Далее: PDF в Word, PDF в текст, Сканировать в PDF. Требования к долговременному хранению описаны в разделе «PDF в PDF/A»; PDF с возможностью поиска не становится автоматически PDF/A.