Отдельный лист для каждой страницы
Каждая выбранная исходная страница становится отдельным листом скачанного XLSX, что упрощает постраничную проверку.
Создавайте редактируемую книгу из строк текста, определяемых по их положению.
Перетащите файлы сюда или используйте кнопку ниже.
До 100 МБ всего · Файлы остаются на вашем устройстве
Просмотрите документ здесь. При добавлении содержимого используйте предварительный просмотр для размещения элементов и проверьте сохранённый результат.
Создайте редактируемую книгу из текста PDF, сгруппированного в строки и разделённого на столбцы по расстояниям. Каждая выбранная страница PDF становится отдельным листом. Это помогает получить табличный текст для тщательной очистки и анализа.
Алгоритм группирует текстовые фрагменты по вертикальному положению и разделяет широкие горизонтальные промежутки на ячейки. Он не распознаёт произвольный смысл таблицы. Значения сохраняются как текст, чтобы сохранить извлечённое содержимое и не интерпретировать его незаметно как формулы.
Каждая выбранная исходная страница становится отдельным листом скачанного XLSX, что упрощает постраничную проверку.
Изменяйте «Порог расстояния между столбцами», чтобы разделять соседние значения или сохранять длинное описание в одной ячейке.
Исключайте верхние и нижние поля в пунктах PDF, чтобы уменьшить число повторяющихся служебных элементов отчёта в извлечённых строках.
Значения хранятся в виде текста. Начальные нули могут оставаться видимыми, а формулировки PDF не превращаются в исполняемые формулы.
Выписка или ведомость PDF может содержать полезные строки, но не предоставлять редактируемую книгу. Извлечение этих строк уменьшает объём ручного набора, когда нужен лист сверки или рабочая таблица данных. Экспорт является отправной точкой для проверки: он определяет выравнивание по печатным позициям, а не по исходным определениям электронной таблицы. Проверяйте идентификаторы и суммы, осознанно назначайте числовые типы и самостоятельно создавайте нужные вычисления. Исходные формулы, диаграммы, смысл объединённых ячеек и логику книги нельзя восстановить лишь потому, что когда-то они послужили основой PDF.
Получите разрешённую таблицу выписки для контролируемого листа сверки. Перед вычислением разниц сверьте даты операций, столбцы дебета и кредита и итоги с PDF.
Извлеките список запасов, чтобы подготовить редактируемую ведомость пересчёта. Сохраняйте коды деталей как текст, проверяйте пустые ячейки количества и удаляйте повторяющиеся заголовки страниц перед добавлением столбцов фактического подсчёта.
Перенесите опубликованную числовую таблицу в книгу для проверяемого анализа. Построчно сравните десятичные разделители и единицы измерения, затем задокументируйте ручные исправления ячеек, определённых алгоритмом.
Выберите PDF с выделяемыми значениями таблицы.
Нажмите на снимок экрана, чтобы увеличить его.
Выберите пробные страницы и уточните настройки строк, столбцов и полей.
Нажмите на снимок экрана, чтобы увеличить его.
Скачайте XLSX и проверьте ячейки перед вычислением итогов.
Нажмите на снимок экрана, чтобы увеличить его.
Снимки экрана показывают этот набор инструментов с безопасными примерными файлами. Имя вашего файла, количество страниц и настройки могут отличаться.
Название последней позиции продолжается на второй строке текста. При экспорте это продолжение попадает в отдельную строку таблицы, которую нужно проверить перед использованием как записи.
В исходной таблице три позиции с итогом 65.00. Название одной позиции занимает две строки.

Эти ячейки прочитаны из скачанного файла. Продолжение последнего названия занимает отдельную строку.

Использованные настройки: Страница 1; исключить 170 pt сверху и 340 pt снизу; допуск строки 3 pt; промежуток столбцов 18 pt. В CSV используются запятые.
Извлечение по расположению не воссоздаёт объединённые записи или формулы. В арабском образце выравнивание также создаёт лишние столбцы. Перед вычислениями сравните каждую строку с PDF.
Проверено . Собственные образцы без конфиденциальных данных обработаны локально в Chromium версией 3.16.0; это не тест производительности рабочего хостинга.
| Настройка | Чего ожидать |
|---|---|
| Поддерживаемые входные данные | |
| Место обработки | Ваш браузер |
| Выбор файлов | Один исходный файл |
| Размер исходных данных | Всего 100 МБ; для декодированных изображений и страниц также действуют ограничения по числу пикселей |
| Выбор страниц | До 200 выбранных страниц за одну операцию. Пустое поле «Страницы» означает все страницы только для PDF, содержащего не более 200 страниц; для более длинного документа используйте отдельные диапазоны. |
Для отсканированных таблиц сначала добавьте проверенный текстовый слой OCR. После этого столбцы определяются по положениям распознанного текста, что может потребовать большей доработки, чем для таблицы, созданной в цифровом виде.
Начните со страницы, содержащей как короткие, так и длинные описания в ячейках. Открыв её лист, сравните одну из первых строк, описание с переносом и последнюю строку итогов с PDF. Если заголовок страницы стал лишней строкой, исключите его верхнее поле в пунктах PDF; 72 пункта равны одному дюйму. Осторожно увеличивайте допуск выравнивания строк, если одна печатная строка разбивается по вертикали. Меняйте порог расстояния между столбцами только после определения границ исходника, которые должны стать границами ячеек. Повторяйте пробный экспорт, пока макет не станет пригодным, затем включите оставшиеся страницы.
Напечатанная надпись «Итого» и соседнее значение не становятся формулой SUM в экспортированном листе. Проверив нужные строки, осознанно преобразуйте суммы в числа и запишите действительно необходимое вычисление. Сохраняйте коды счетов, длинные идентификаторы и значения с начальными нулями как текст. Сравните заново вычисленный итог с исходником и выясните причину расхождения перед изменением данных. Страницу PDF с несколькими не связанными друг с другом таблицами может потребоваться вручную разделить на отдельные проверенные таблицы.
| Ситуация | Что делать |
|---|---|
| Два столбца объединились в один | Уменьшите порог расстояния между столбцами и сравните пробную строку с PDF. |
| Длинное описание разделилось на несколько ячеек | Увеличьте порог расстояния. Таблицы с разной шириной столбцов или многострочными записями всё равно могут потребовать ручной доработки. |
| Итог не вычисляется в Excel | Исходный PDF содержит значения, а не повторно используемые формулы. Осознанно преобразуйте проверенные числовые ячейки и при необходимости создайте формулы заново. |
Для таблицы счёта построчно сравните описания позиций, количество, цены за единицу, коды с начальными нулями и итоги. Проверьте расположение пустых ячеек. Даже успешно открывающаяся книга может содержать значение не в том столбце, поэтому проверка таблицы является частью задачи преобразования.
Извлечённые ячейки записываются как текст. Проверьте их и явно задайте числовые типы или типы дат в приложении электронных таблиц.
Расстояния в PDF не всегда определяют реальные столбцы таблицы. Объединённые заголовки, пропорциональный текст и нерегулярное выравнивание требуют ручной доработки.
Сравните количество строк и важные ячейки с PDF. Рассматривайте идентификаторы как текст, явно выбирайте числовые типы и сверяйте итоги перед вычислениями.
Нет. Он создаёт лист для каждой выбранной страницы, используя текстовые ячейки на основе положения. Заново создайте проверенные формулы и осознанно объедините таблицы после согласования заголовков. Исходные формулы электронной таблицы и смысл объединённых ячеек не хранятся в обычном печатном тексте PDF.
Скан может содержать только изображение таблицы. Сначала добавьте проверенный текстовый слой OCR, затем экспортируйте типичную страницу. Распознавание может внести неверные цифры или неравномерные промежутки, поэтому сравните полученные ячейки со сканом перед вычислениями.
Далее: PDF в CSV, Excel в PDF, Распознать текст в PDF (OCR).