PDF в XML

Извлекайте текстовые элементы PDF и геометрию страниц в описанную структуру XML.

Выберите файлы PDF

Перетащите файлы сюда или используйте кнопку ниже.

До 25 МБ всего · Файлы остаются на вашем устройстве

СодержаниеРазделов: 10

Что содержит экспорт XML?

Экспортируйте выделяемый текстовый слой PDF в XML. Файл группирует текстовые элементы по исходным номерам страниц и сохраняет геометрию страниц, направление текста и преобразования положения. Он предоставляет структурированные данные для проверки и последующей обработки.

XML описывает результат извлечения средством чтения текста PDF. Это не исходный XML, из которого мог быть создан документ; он не определяет поля счетов, не восстанавливает отношения таблиц и не экспортирует изображения. Страницам только с изображениями сначала требуется OCR.

Возможности PDF в XML

Элементы по страницам

Сохраните номера исходных страниц, поворот и границы видимой области рядом с извлечённым текстом. Это даёт удобную ссылку при проверке выбранного диапазона.

Экранированные текстовые значения

Амперсанды, угловые скобки и другие символы остаются данными внутри элементов XML. Текст, похожий на разметку, не может стать исполняемым содержимым страницы через этот экспорт.

Обратимое представление особых строк

Для символов, которые XML не может представить напрямую, используется явно помеченная кодировка строки JSON. Пометка позволяет принимающей программе точно восстановить значения.

Обработка в браузере

Создайте файл XML на своём устройстве. Исходный файл не загружается для конвертации и не переписывается.

Как извлечь XML из PDF?

  1. Выберите незашифрованный PDF с выделяемым текстом.
  2. Введите нужные номера или диапазоны в поле «Страницы».
  3. Преобразуйте файл и скачайте результат XML.
  4. Откройте XML в текстовом редакторе или приложении с поддержкой XML.
  5. Сравните известную страницу и фразу, прежде чем сопоставлять элементы другой системе.

Выберите исходный PDF

Выберите PDF с читаемым текстовым слоем.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в XML: выбор исходного PDF.

Ограничьте диапазон страниц

Выберите страницы, необходимые для извлечения XML.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в XML: диапазон страниц и ограничения извлечения.

Сохраните XML

Скачайте XML и проверьте его элементы страниц.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в XML: скачивание завершённого экспорта XML.

Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.

Зачем использовать XML для проверки текста PDF?

Процессу на основе XML могут понадобиться явные элементы страниц и текста перед применением собственных правил преобразования. Команда может проверить эти элементы, сохранить ссылки на исходные страницы и создать отдельное сопоставление для известных типов документов. Отделяйте сопоставление от извлечения: близость текстовых элементов сама по себе не устанавливает бизнес-связь.

Кто может работать с этим результатом XML?

Разработчики интеграций

Используйте элементы страниц и текста как входные данные контролируемого процесса обработки документов.

Архивисты документов

Проверьте, остаётся ли текст доступным вместе с сохранённым исходным PDF.

Аудиторы данных

Сравните выборочные выходные значения с исходными страницами, прежде чем принимать правила преобразования.

Настройки и проверка результата

НастройкаЧто ожидать
ИсточникОдин PDF до 25 MiB, содержащий не более 500 исходных страниц.
Диапазон страницДо 200 выбранных страниц. Пустой диапазон включает все страницы, только если это не превышает ограничение.
Ограничения текстаДо 20 000 элементов на странице, 100 000 за обработку и двух миллионов текстовых символов.
СкачиваниеДокумент XML до 64 MiB. Внешние DTD и схемы не запрашиваются.

Сопоставьте знакомую подпись после проверки страницы

Для документа о доставке экспортируйте одну страницу и найдите знакомый номер ссылки. Сверьте его преобразование текста и соседние элементы с исходной страницей. Затем приложение может применить правило для этого типа документа. Не считайте любые соседние числа одним и тем же полем в несвязанных макетах.

Устранение проблем PDF в XML

СитуацияЧто проверить
XML не соответствует схеме поставщикаЭкспорт использует собственную структуру извлечения. Создайте отдельное сопоставление со схемой, которую ожидает принимающая система.
У элемента есть атрибут encodingЕсли значение encoding — json, разберите его текст как строку JSON, чтобы восстановить символы, которые нельзя записать в XML напрямую.
Слова отсутствуют или расположены неожиданноПроверьте наличие сканированных страниц или необычного размещения текста. При необходимости примените OCR и проверьте координаты.

Частые вопросы

Восстанавливает ли PDF в XML первоначальный исходный XML?

Нет. PDF обычно не сохраняет исходную модель данных. Этот экспорт записывает текстовый слой и геометрию, которые может извлечь средство чтения.

Преобразуются ли теги PDF в модель документа XML?

Нет. Инструмент не восстанавливает семантику тегированного PDF, заголовки или структуру таблиц. Его элементы страниц и текста описывают результаты извлечения.

Можно ли преобразовать этот XML обратно в тот же PDF?

Инструмент XML в PDF может напечатать исходный XML, но не воссоздаёт исходное оформление страницы из файла извлечения. Сохраните оригинальный PDF.

Связанные инструменты

XML в PDF, PDF в JSON, OCR PDF.