PDF в текст

Извлекайте существующий текстовый слой в текстовый файл UTF-8.

Выберите файлы PDF

Перетащите файлы сюда или используйте кнопку ниже.

До 100 МБ всего · Файлы остаются на вашем устройстве

СодержаниеРазделов: 11

Что можно извлечь из PDF в виде обычного текста?

Извлеките существующий текстовый слой PDF для поиска, копирования или дальнейшего редактирования. Строки группируются по их положению на странице. Это особенно полезно для преимущественно текстовых отчётов и архивов документов.

Результат содержит обычный текст без шрифтов, изображений и оформления страниц. Порядок чтения на страницах с несколькими колонками может отличаться от видимого макета. Этой операцией нельзя распознать отсканированную страницу без текстового слоя.

Возможности преобразования PDF в текст

Извлечение существующего текста

Считывайте выделяемый текстовый слой документа, а не распознавайте буквы на отсканированных изображениях.

Выбор нужных страниц

Ограничьте экспорт главой, письмом или приложением с помощью поля «Страницы».

Универсальный результат TXT

Скачайте обычный текстовый файл, который открывается в распространённых текстовых редакторах без макета текстового процессора.

Группировка строк по положению

Расположенные рядом текстовые фрагменты объединяются в строки. Порядок чтения нескольких колонок по-прежнему нужно сверять со страницей.

Зачем переносить текст PDF в текстовый файл?

Обычный текст полезен, когда слова важнее печатного макета. Он позволяет искать в локальной папке, копировать формулировки в редактор или подготовить чистую основу для заметок. Кроме того, для текстовой задачи не приходится переносить оформление страниц с большим количеством изображений. Текстовый слой не всегда совпадает с тем, что видно на странице: лигатуры, скрытые ошибки OCR и порядок колонок могут изменить экспорт. Проверьте типичные абзацы, важные имена и числа, прежде чем использовать результат в дальнейшей работе.

Кто использует извлечённый текст PDF?

Университетские исследователи

Экспортируйте текст разрешённой к использованию статьи, чтобы собрать цитаты и составить заметки о прочитанном. Сверяйте каждую цитату с исходной страницей и отдельно записывайте её номер.

Административные работники

Перенесите текст стандартного письма в текстовый редактор для подготовки новой редакции. Проверьте обращения, даты и переносы строк, прежде чем вставлять его в шаблон организации.

Технические писатели

Получите формулировки спецификации для рабочей заметки с возможностью поиска. Сравните единицы измерения, символы и нумерованные действия с PDF: необычные кодировки шрифтов могут менять извлечённые символы.

Как извлечь текст из PDF?

  1. Выберите PDF с выделяемым текстом. Если это скан, состоящий только из изображений, сначала создайте текстовый слой с помощью OCR.
  2. Введите страницы для извлечения или оставьте поле «Страницы» пустым для всего документа. При необходимости задайте имя файла для скачивания.
  3. Запустите извлечение и скачайте файл TXT. Откройте его в текстовом редакторе.
  4. Сравните порядок абзацев, пунктуацию, имена и важные числа с исходным PDF, прежде чем редактировать или цитировать текст.

Выберите исходный файл

Выберите PDF с существующим выделяемым текстовым слоем.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в текст, шаг 1: Выберите PDF с существующим выделяемым текстовым слоем.

Проверьте настройки инструмента

Выберите страницы и при необходимости задайте имя файла для скачивания.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в текст, шаг 2: Выберите страницы и при необходимости задайте имя файла для скачивания.

Скачайте и проверьте результат

Скачайте файл TXT и сравните его текст с PDF.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в текст, шаг 3: Скачайте файл TXT и сравните его текст с PDF.

Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.

Настройки и проверка результата

НастройкаЧего ожидать
Поддерживаемые входные данныеPDF
Место обработкиВаш браузер
Выбор файловОдин исходный файл
Размер исходных данныхВсего 100 МБ; для декодированных изображений и страниц также действуют ограничения по числу пикселей
Выбор страницДо 200 выбранных страниц за одну операцию. Пустое поле «Страницы» означает все страницы только для PDF, содержащего не более 200 страниц; для более длинного документа используйте отдельные диапазоны.

Если текст нельзя выделить, потому что страница является сканом, добавьте и проверьте текстовый слой OCR перед извлечением текста.

Проверьте порядок чтения и кодировку символов

Текстовые фрагменты могут храниться в PDF в порядке, отличающемся от их видимого расположения. Боковые врезки, сноски и двухколоночные макеты часто становятся причиной разрывов экспортированного предложения. Видимая буква также может зависеть от таблицы соответствия шрифта, которая при извлечении выдаёт другой символ. Сравните абзац, пересекающий границу колонки или страницы, проверьте технические символы и лигатуры, например «fi», прежде чем считать TXT надёжным воспроизведением исходного текста.

Решение проблем при преобразовании PDF в текст

СитуацияЧто делать
Текстовый файл пуст или преобразование отклоняетсяУ выбранных страниц может не быть текстового слоя. Сначала используйте OCR, если оно доступно.
Некоторые буквы неверныКодировка текста PDF или слой OCR могут содержать ошибки. Сравните имена, числа и символы с видимой страницей.
Нужен редактируемый документ с форматированиемИспользуйте «PDF в Word» как основу DOCX; точность макета по-прежнему нужно проверять.

Практический пример и итоговая проверка

Представьте два столбца: A1, A2 слева и B1, B2 справа. Группировка по координатам может дать A1 B1, затем A2 B2, смешав столбцы. Прочитайте каждый столбец в PDF, прежде чем переставлять извлечённые строки: аккуратный текстовый файл тоже может соединить несвязанные предложения.

Частые вопросы

Можно ли извлечь текст из отсканированного PDF?

Сначала запустите OCR, чтобы добавить распознанный текст. При выборе исходника, состоящего только из изображений, появляется понятное сообщение об отсутствии текста.

Сохраняет ли инструмент абзацы?

Группировка по положению приблизительно восстанавливает порядок строк. Разрывы абзацев и сложные колонки требуют редакторской проверки.

Как отделяются страницы в скачанном текстовом файле?

Текст выбранных страниц объединяется с пустыми строками между ними. Если нужны точные ссылки на исходный PDF, сохраните физический диапазон страниц в своих заметках.

Связанные инструменты и руководства

Далее: Распознать текст в PDF (OCR), Просмотр PDF. Для результата на другом языке изучите порядок перевода PDF; само извлечение текста не выполняет перевод.