Элементы по страницам
Сохраните номера исходных страниц, поворот и границы видимой области рядом с извлечённым текстом. Это даёт удобную ссылку при проверке выбранного диапазона.
Извлекайте текстовые элементы PDF и геометрию страниц в описанную структуру XML.
Перетащите файлы сюда или используйте кнопку ниже.
До 25 МБ всего · Файлы остаются на вашем устройстве
Просмотрите документ здесь. При добавлении содержимого используйте предварительный просмотр для размещения элементов и проверьте сохранённый результат.
Экспортируйте выделяемый текстовый слой PDF в XML. Файл группирует текстовые элементы по исходным номерам страниц и сохраняет геометрию страниц, направление текста и преобразования положения. Он предоставляет структурированные данные для проверки и последующей обработки.
XML описывает результат извлечения средством чтения текста PDF. Это не исходный XML, из которого мог быть создан документ; он не определяет поля счетов, не восстанавливает отношения таблиц и не экспортирует изображения. Страницам только с изображениями сначала требуется OCR.
Сохраните номера исходных страниц, поворот и границы видимой области рядом с извлечённым текстом. Это даёт удобную ссылку при проверке выбранного диапазона.
Амперсанды, угловые скобки и другие символы остаются данными внутри элементов XML. Текст, похожий на разметку, не может стать исполняемым содержимым страницы через этот экспорт.
Для символов, которые XML не может представить напрямую, используется явно помеченная кодировка строки JSON. Пометка позволяет принимающей программе точно восстановить значения.
Создайте файл XML на своём устройстве. Исходный файл не загружается для конвертации и не переписывается.
Выберите PDF с читаемым текстовым слоем.
Нажмите на снимок экрана, чтобы увеличить его.
Выберите страницы, необходимые для извлечения XML.
Нажмите на снимок экрана, чтобы увеличить его.
Скачайте XML и проверьте его элементы страниц.
Нажмите на снимок экрана, чтобы увеличить его.
Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.
Процессу на основе XML могут понадобиться явные элементы страниц и текста перед применением собственных правил преобразования. Команда может проверить эти элементы, сохранить ссылки на исходные страницы и создать отдельное сопоставление для известных типов документов. Отделяйте сопоставление от извлечения: близость текстовых элементов сама по себе не устанавливает бизнес-связь.
Используйте элементы страниц и текста как входные данные контролируемого процесса обработки документов.
Проверьте, остаётся ли текст доступным вместе с сохранённым исходным PDF.
Сравните выборочные выходные значения с исходными страницами, прежде чем принимать правила преобразования.
| Настройка | Что ожидать |
|---|---|
| Источник | Один PDF до 25 MiB, содержащий не более 500 исходных страниц. |
| Диапазон страниц | До 200 выбранных страниц. Пустой диапазон включает все страницы, только если это не превышает ограничение. |
| Ограничения текста | До 20 000 элементов на странице, 100 000 за обработку и двух миллионов текстовых символов. |
| Скачивание | Документ XML до 64 MiB. Внешние DTD и схемы не запрашиваются. |
Для документа о доставке экспортируйте одну страницу и найдите знакомый номер ссылки. Сверьте его преобразование текста и соседние элементы с исходной страницей. Затем приложение может применить правило для этого типа документа. Не считайте любые соседние числа одним и тем же полем в несвязанных макетах.
| Ситуация | Что проверить |
|---|---|
| XML не соответствует схеме поставщика | Экспорт использует собственную структуру извлечения. Создайте отдельное сопоставление со схемой, которую ожидает принимающая система. |
| У элемента есть атрибут encoding | Если значение encoding — json, разберите его текст как строку JSON, чтобы восстановить символы, которые нельзя записать в XML напрямую. |
| Слова отсутствуют или расположены неожиданно | Проверьте наличие сканированных страниц или необычного размещения текста. При необходимости примените OCR и проверьте координаты. |
Нет. PDF обычно не сохраняет исходную модель данных. Этот экспорт записывает текстовый слой и геометрию, которые может извлечь средство чтения.
Нет. Инструмент не восстанавливает семантику тегированного PDF, заголовки или структуру таблиц. Его элементы страниц и текста описывают результаты извлечения.
Инструмент XML в PDF может напечатать исходный XML, но не воссоздаёт исходное оформление страницы из файла извлечения. Сохраните оригинальный PDF.