Извлечение существующего текста
Считывайте выделяемый текстовый слой документа, а не распознавайте буквы на отсканированных изображениях.
Извлекайте существующий текстовый слой в текстовый файл UTF-8.
Перетащите файлы сюда или используйте кнопку ниже.
До 100 МБ всего · Файлы остаются на вашем устройстве
Просмотрите документ здесь. При добавлении содержимого используйте предварительный просмотр для размещения элементов и проверьте сохранённый результат.
Извлеките существующий текстовый слой PDF для поиска, копирования или дальнейшего редактирования. Строки группируются по их положению на странице. Это особенно полезно для преимущественно текстовых отчётов и архивов документов.
Результат содержит обычный текст без шрифтов, изображений и оформления страниц. Порядок чтения на страницах с несколькими колонками может отличаться от видимого макета. Этой операцией нельзя распознать отсканированную страницу без текстового слоя.
Считывайте выделяемый текстовый слой документа, а не распознавайте буквы на отсканированных изображениях.
Ограничьте экспорт главой, письмом или приложением с помощью поля «Страницы».
Скачайте обычный текстовый файл, который открывается в распространённых текстовых редакторах без макета текстового процессора.
Расположенные рядом текстовые фрагменты объединяются в строки. Порядок чтения нескольких колонок по-прежнему нужно сверять со страницей.
Обычный текст полезен, когда слова важнее печатного макета. Он позволяет искать в локальной папке, копировать формулировки в редактор или подготовить чистую основу для заметок. Кроме того, для текстовой задачи не приходится переносить оформление страниц с большим количеством изображений. Текстовый слой не всегда совпадает с тем, что видно на странице: лигатуры, скрытые ошибки OCR и порядок колонок могут изменить экспорт. Проверьте типичные абзацы, важные имена и числа, прежде чем использовать результат в дальнейшей работе.
Экспортируйте текст разрешённой к использованию статьи, чтобы собрать цитаты и составить заметки о прочитанном. Сверяйте каждую цитату с исходной страницей и отдельно записывайте её номер.
Перенесите текст стандартного письма в текстовый редактор для подготовки новой редакции. Проверьте обращения, даты и переносы строк, прежде чем вставлять его в шаблон организации.
Получите формулировки спецификации для рабочей заметки с возможностью поиска. Сравните единицы измерения, символы и нумерованные действия с PDF: необычные кодировки шрифтов могут менять извлечённые символы.
Выберите PDF с существующим выделяемым текстовым слоем.
Нажмите на снимок экрана, чтобы увеличить его.
Выберите страницы и при необходимости задайте имя файла для скачивания.
Нажмите на снимок экрана, чтобы увеличить его.
Скачайте файл TXT и сравните его текст с PDF.
Нажмите на снимок экрана, чтобы увеличить его.
Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.
| Настройка | Чего ожидать |
|---|---|
| Поддерживаемые входные данные | |
| Место обработки | Ваш браузер |
| Выбор файлов | Один исходный файл |
| Размер исходных данных | Всего 100 МБ; для декодированных изображений и страниц также действуют ограничения по числу пикселей |
| Выбор страниц | До 200 выбранных страниц за одну операцию. Пустое поле «Страницы» означает все страницы только для PDF, содержащего не более 200 страниц; для более длинного документа используйте отдельные диапазоны. |
Если текст нельзя выделить, потому что страница является сканом, добавьте и проверьте текстовый слой OCR перед извлечением текста.
Текстовые фрагменты могут храниться в PDF в порядке, отличающемся от их видимого расположения. Боковые врезки, сноски и двухколоночные макеты часто становятся причиной разрывов экспортированного предложения. Видимая буква также может зависеть от таблицы соответствия шрифта, которая при извлечении выдаёт другой символ. Сравните абзац, пересекающий границу колонки или страницы, проверьте технические символы и лигатуры, например «fi», прежде чем считать TXT надёжным воспроизведением исходного текста.
| Ситуация | Что делать |
|---|---|
| Текстовый файл пуст или преобразование отклоняется | У выбранных страниц может не быть текстового слоя. Сначала используйте OCR, если оно доступно. |
| Некоторые буквы неверны | Кодировка текста PDF или слой OCR могут содержать ошибки. Сравните имена, числа и символы с видимой страницей. |
| Нужен редактируемый документ с форматированием | Используйте «PDF в Word» как основу DOCX; точность макета по-прежнему нужно проверять. |
Представьте два столбца: A1, A2 слева и B1, B2 справа. Группировка по координатам может дать A1 B1, затем A2 B2, смешав столбцы. Прочитайте каждый столбец в PDF, прежде чем переставлять извлечённые строки: аккуратный текстовый файл тоже может соединить несвязанные предложения.
Сначала запустите OCR, чтобы добавить распознанный текст. При выборе исходника, состоящего только из изображений, появляется понятное сообщение об отсутствии текста.
Группировка по положению приблизительно восстанавливает порядок строк. Разрывы абзацев и сложные колонки требуют редакторской проверки.
Текст выбранных страниц объединяется с пустыми строками между ними. Если нужны точные ссылки на исходный PDF, сохраните физический диапазон страниц в своих заметках.
Далее: Распознать текст в PDF (OCR), Просмотр PDF. Для результата на другом языке изучите порядок перевода PDF; само извлечение текста не выполняет перевод.