PDF с возможностью поиска или TXT
Скачайте распознанные формулировки как обычный текст или добавьте текстовый слой поверх сохранённого внешнего вида скана в PDF.
Сделайте сканы доступными для поиска, сохранив исходный вид страниц.
Перетащите файлы сюда или используйте кнопку ниже.
До 100 МБ всего · Файлы остаются на вашем устройстве
Просмотрите документ здесь. При добавлении содержимого используйте предварительный просмотр для размещения элементов и проверьте сохранённый результат.
Добавьте текстовый слой с возможностью поиска в отсканированный PDF с помощью Tesseract, работающего в браузере. Выберите язык оригинала; по умолчанию выбран русский. Совместимые программы просмотра смогут искать и выделять распознанные слова, а отсканированная страница сохранит исходный вид.
По умолчанию операция сохраняет страницы, на которых уже есть текст. Можно также распознать каждую выбранную страницу; это добавляет новый слой и может продублировать существующий текст. Точность OCR зависит от резкости, контрастности, языка и ориентации страницы. Мелкий шрифт, рукописный текст, необычные гарнитуры и сканы с помехами требуют тщательной проверки, а не автоматического доверия.
Скачайте распознанные формулировки как обычный текст или добавьте текстовый слой поверх сохранённого внешнего вида скана в PDF.
Скачанный документ содержит только выбранные страницы. Выберите до 20 страниц; оставляйте поле «Страницы» пустым для всего документа только тогда, когда в нём не более 20 страниц.
Выберите язык оригинала, 200 или 300 DPI, поворот для распознавания и режим разметки: автоматический, единый блок или разреженный текст. Поддерживаемые языки перечислены в разделе вопросов ниже.
Страницы, уже содержащие текст, можно сохранить. Принудительно запускайте распознавание только после оценки возможного дублирования текстовых слоёв.
Скан хранит страницу как картинку, поэтому обычный поиск текста не находит напечатанные на ней слова. OCR на выбранном языке может сделать скан печатного текста доступным для поиска и предоставить текст для копирования и вставки или последующего извлечения. Это особенно полезно для архивов, где найти известное имя или фразу важнее, чем изменить оформление страницы. Распознанный слой может содержать ошибки, даже если скан выглядит чётким. Проверьте поиск и выделение, затем сравните имена, ссылки и числа с изображением страницы перед использованием извлечённого текста.
Сделайте короткий печатный документ доступным для поиска по заголовку, имени или номеру документа. Сохраните исходный скан и проверьте эти поисковые слова в скачанной копии, включая легко путаемые символы.
Сделайте печатные материалы курса доступными для поиска, прежде чем составлять учебные заметки. Рукописные пометки могут оставаться ненадёжно распознанными, поэтому сверяйте цитируемые отрывки со сканом.
Извлеките текст из разрешённой отсканированной служебной записки для внутреннего указателя. Тщательно сравните даты, имена сотрудников и регистрационные номера: один распознанный символ может изменить идентификатор.
Выберите скан на поддерживаемом языке и не более 20 страниц.
Нажмите на снимок экрана, чтобы увеличить его.
Выберите язык источника, результат OCR, разрешение, разметку и ориентацию распознавания.
Нажмите на снимок экрана, чтобы увеличить его.
Скачайте результат и сравните распознанный текст с исходным сканом.
Нажмите на снимок экрана, чтобы увеличить его.
Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.
Исходная страница является изображением без извлекаемого текста. OCR добавляет текстовый слой, сохраняя вид страницы. Поэтому оба изображения выглядят одинаково; скачиваемый результат также содержит распознанные слова.
Извлечение текста из исходника вернуло ноль символов.

Результат содержит все шесть строк образца. Пиксели сформированного изображения совпадают с исходником при проверенном размере изображения 1 300 пикселей.

СПИСОК ДЛЯ СЕМИНАРА Подтвердите бронирование помещения. Распечатайте сорок копий материалов. Проверьте проектор до 09:00. Сохраните окончательный список участников. Это безобидный пример распознавания текста.
Использованные настройки: Страница 1; PDF с поиском по тексту; русский язык; распознавание при 200 DPI; один блок текста; исходная ориентация.
Этот чёткий русскоязычный образец с крупным шрифтом не является эталоном точности для мелкого шрифта, рукописного текста, наклонных сканов или других языков. Проверьте имена, суммы и даты в собственном результате.
Проверено . Безобидные файлы примеров обработаны в русской версии темы 3.9.0 с помощью локального браузера Chromium. Эти примеры не служат показателем производительности рабочего хостинга.
| Настройка | Чего ожидать |
|---|---|
| Поддерживаемые входные данные | |
| Место обработки | В вашем браузере, на вашем устройстве |
| Выбор файлов | Один исходный файл |
| Размер исходных данных | До 100 МБ с учётом памяти устройства и ограничений декодированных страниц |
| Пакет распознавания | До 20 выбранных страниц; только они входят в скачанный PDF с возможностью поиска. |
Инструмент добавляет текстовый слой; он не восстанавливает таблицы как редактируемую электронную таблицу и не исправляет фактическое содержание. OCR не заменяет проверку имён, номеров счетов и другого текста, требующего точности.
Настройка поворота разворачивает изображение скана, передаваемое на распознавание; PDF с возможностью поиска сохраняет вид исходной страницы. Это не замена инструменту «Повернуть PDF», если читатели должны видеть страницу в правильной ориентации. Если существующий текстовый слой содержит ошибки, принудительное распознавание может добавить ещё один слой и дать повторяющиеся результаты поиска. В такой ситуации OCR в обычный текст может быть полезным способом получить проверенное извлечение. Сравнивайте с изображением легко путаемые символы, например 0/O, 1/l и десятичные точки.
| Ситуация | Что делать |
|---|---|
| Имя или число распознано неверно | Сравните распознанный текст с изображением. Перед повторным использованием исправьте его в подходящем редакторе на следующем этапе. |
| Существующий неверный слой OCR не улучшился | Выберите «Распознать все выбранные страницы», чтобы добавить новый слой. Существующий текст сохраняется, поэтому имеющийся слой может давать повторяющиеся результаты поиска; экспортируйте обычный текст, если нужно чистое извлечение. |
| Большой комплект документов отклоняется | Разделите его на группы по 20 страниц или меньше, распознайте каждую группу и проверьте их перед объединением. |
Для печатного листа осмотра найдите известный идентификатор оборудования в PDF с возможностью поиска, затем скопируйте этот идентификатор и одно измерение в текстовый редактор. Сравните оба значения со сканом и убедитесь, что выделяется нужная строка. Один успешный поиск слова не доказывает правильный порядок чтения или надёжное извлечение чисел.
Результат остаётся PDF с добавленным текстовым слоем. Если нужен текстовый документ с изменяемым расположением текста, затем используйте «PDF в Word».
В этот выпуск входят модели распознавания русского, английского, испанского, португальского, немецкого, индонезийского, французского, итальянского, турецкого, арабского, упрощённого китайского, японского, корейского, польского и хинди языков. По умолчанию выбран русский; выбирайте язык, соответствующий исходнику. OCR распознаёт символы, но не переводит документ. Для других языков нужен отдельно настроенный способ OCR.
Настройка по умолчанию сохраняет страницы с существующим текстовым слоем. Выберите «Распознать все выбранные страницы», чтобы выполнить распознавание и для них.
Нет. PDF с возможностью поиска содержит только выбранные страницы. Чтобы сохранить длинный документ целиком, распознавайте группы до 20 страниц и объединяйте проверенные результаты в исходном порядке.
Нет. Он поворачивает изображение, передаваемое на распознавание, сохраняя вид исходной страницы в PDF. Сначала используйте «Повернуть PDF», если сама сохранённая страница должна отображаться в правильной ориентации.
Инструмент распознаёт текст на выбранном языке, но не обещает надёжного распознавания рукописей и не восстанавливает ячейки таблиц. Используйте чёткий, правильно ориентированный скан печатного текста и проверьте слова перед переносом в Word или электронную таблицу.
Далее: PDF в Word, PDF в текст, Сканировать в PDF. Требования к долговременному хранению описаны в разделе «PDF в PDF/A»; PDF с возможностью поиска не становится автоматически PDF/A.