PDF в JSON

Экспортируйте выделяемый текст, геометрию страниц и положения текста в JSON.

Выберите файлы PDF

Перетащите файлы сюда или используйте кнопку ниже.

До 25 МБ всего · Файлы остаются на вашем устройстве

СодержаниеРазделов: 10

Что можно извлечь из PDF в JSON?

Преобразуйте текстовый слой PDF в файл JSON для проверки или дальнейшей обработки. Экспорт сохраняет выбранные страницы, их размеры и текстовые элементы, возвращённые средством чтения PDF, включая положения и преобразования.

PDF хранит инструкции по отображению страницы. Этот инструмент не определяет поля счетов, не восстанавливает таблицы и не распознаёт исходные уровни заголовков. Для появления слов со сканированных страниц в экспорте сначала требуется OCR.

Возможности PDF в JSON

Выбор страниц

Экспортируйте определённый диапазон, сохраняя исходные номера страниц. Так проще проверить небольшой образец перед обработкой длинного документа.

Текст с координатами

Сохраните текстовые элементы вместе с геометрией страниц и сведениями о положении. Используйте исходный PDF для интерпретации координат и проверки визуальных связей между элементами.

Машиночитаемый результат

Скачайте корректный JSON для собственного анализатора или процесса проверки. Экспортируемый текст экранируется как данные; инструмент не выполняет содержимое документа.

Локальная обработка

Прочитайте выбранный PDF в браузере. Документ не отправляется на сервер конвертации, а исходный файл не изменяется.

Как преобразовать текст PDF в JSON?

  1. Выберите незашифрованный PDF, текст которого можно выделить в программе просмотра.
  2. Введите номера страниц, например 1, 3-5, или оставьте поле «Страницы» пустым, чтобы включить все допустимые страницы.
  3. Запустите преобразование и скачайте файл JSON.
  4. Откройте его в программе просмотра или редакторе JSON и сравните знакомую фразу с соответствующей страницей PDF.
  5. Проверьте координаты, порядок чтения и пустые страницы, прежде чем использовать данные в другом приложении.

Выберите PDF

Выберите PDF с выделяемым текстом.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в JSON: выбор образца PDF с текстовым слоем.

Выберите страницы

Задайте диапазон страниц и проверьте ограничения извлечения.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в JSON: выбор страниц и настройки извлечения.

Скачайте JSON

Сохраните JSON и сравните его с исходной страницей.

Нажмите на снимок экрана, чтобы увеличить его.
PDF в JSON: скачивание готового экспорта структурированного текста.

Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.

Зачем экспортировать текст PDF в JSON?

JSON полезен, когда процесс работы с документами требует и текст, и его положение. Разработчик может проверить качество извлечения, найти повторяющиеся подписи или подготовить отдельное сопоставление полей. Задавайте его явно: соседняя сумма не становится автоматически итогом счёта, а порядок извлечения не обязательно соответствует порядку чтения человеком.

Кому подходит этот экспорт?

Разработчики обработки документов

Проверьте текстовый слой перед созданием анализатора и сохраните ссылки на страницы для отладки.

Команды проверки данных

Сравните выборочные значения с исходной страницей, прежде чем принять правило извлечения.

Студенты и исследователи

Изучите, как видимый текст представлен в документе с фиксированным макетом.

Настройки и проверка результата

НастройкаЧто ожидать
Входные данныеОдин PDF размером до 25 MiB и до 500 исходных страниц.
ВыборДо 200 выбранных страниц; до 20 000 текстовых элементов на странице, 100 000 за обработку и двух миллионов символов текста.
РезультатJSON с извлечённым текстом и геометрией; не более 64 MiB.
Сканированные страницыБез автоматического OCR, экспорта изображений и распознавания полей документа.

Проверьте небольшой образец перед созданием анализатора

Для выписки в две колонки сначала экспортируйте одну страницу. Найдите знакомую подпись и сравните её положение с напечатанным значением. Если элементы колонок чередуются, сгруппируйте их по координатам в своём коде, а не считайте массив уже готовой таблицей.

Устранение проблем PDF в JSON

СитуацияЧто проверить
Выделяемый текст не найденВыполните OCR сканированных страниц, затем экспортируйте текстовый слой полученного PDF.
Текст расположен в неожиданном порядкеСравните страницу и положения текста: порядок извлечения не задаёт порядок чтения.
Большой диапазон отклонёнВыберите меньше страниц. Плотные страницы могут достичь ограничения текстовых элементов раньше ограничения страниц.

Частые вопросы

Распознаёт ли PDF в JSON поля счетов?

Нет. Результат содержит текстовые элементы и геометрию. Названия полей, связи и проверка бизнес-правил требуют отдельного сопоставления.

Включаются ли изображения и таблицы?

Изображения не экспортируются. Текст внутри таблицы можно извлечь, но связи строк и столбцов не восстанавливаются.

Можно ли воссоздать исходный PDF из этого JSON?

Экспорт — это формат для проверки, а не полное представление PDF. Сохраните исходный PDF для оформления, графики, шрифтов и интерактивных возможностей.

Связанные инструменты

JSON в PDF, PDF в XML, OCR PDF.