PDF na JSON

Eksportuj zaznaczalny tekst, geometrię stron i położenie tekstu do JSON.

Wybierz pliki PDF

Przeciągnij pliki tutaj lub użyj przycisku poniżej.

Do 25 MB łącznie · Pliki pozostają na Twoim urządzeniu

Spis treściSekcje: 10

Co można wyodrębnić z PDF do JSON?

Zamień warstwę tekstową PDF w plik JSON do analizy lub dalszego przetwarzania. Eksport zapisuje wybrane strony, ich wymiary oraz elementy tekstowe zwrócone przez czytnik PDF, w tym ich położenie i przekształcenia.

PDF przechowuje instrukcje wyświetlania strony. To narzędzie nie rozpoznaje pól faktury, nie odbudowuje tabel ani nie ustala pierwotnych poziomów nagłówków. Strony zeskanowane wymagają wcześniejszego OCR, aby ich słowa mogły pojawić się w eksporcie.

Funkcje konwersji PDF na JSON

Wybór stron

Eksportuj określony zakres stron z zachowaniem pierwotnej numeracji. Ułatwia to sprawdzenie małej próbki przed przetworzeniem dłuższego dokumentu.

Tekst ze współrzędnymi

Zachowaj elementy tekstowe razem z geometrią strony i informacjami o położeniu. Odczytuj współrzędne w odniesieniu do oryginalnego PDF i sprawdzaj wizualne relacje między elementami.

Dane czytelne maszynowo

Pobierz poprawny JSON do własnego parsera lub procesu weryfikacji. Eksportowany tekst jest zabezpieczany sekwencjami ucieczki jako dane; narzędzie nie wykonuje treści dokumentu.

Przetwarzanie lokalne

Odczytuj wybrany PDF w przeglądarce. Dokument nie jest wysyłany na serwer konwersji, a oryginalny plik nie ulega zmianie.

Jak przekonwertować tekst PDF na JSON?

  1. Wybierz niezaszyfrowany PDF, którego tekst można zaznaczyć w czytniku.
  2. Wpisz numery stron, na przykład 1, 3-5, albo pozostaw pole Strony puste, aby uwzględnić wszystkie dozwolone strony.
  3. Rozpocznij konwersję i pobierz plik JSON.
  4. Otwórz go w przeglądarce lub edytorze JSON i porównaj znaną frazę z odpowiednią stroną PDF.
  5. Przed użyciem danych w innej aplikacji sprawdź współrzędne, kolejność czytania oraz ewentualne puste strony.

Wybierz PDF

Wybierz PDF zawierający zaznaczalny tekst.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na JSON: wybór przykładowego PDF z warstwą tekstową.

Wybierz strony

Ustaw zakres stron i zapoznaj się z limitami ekstrakcji.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na JSON: wybór stron i ustawienia ekstrakcji.

Pobierz JSON

Zapisz JSON i porównaj go ze stroną źródłową.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na JSON: pobieranie gotowego eksportu uporządkowanego tekstu.

Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.

Dlaczego warto eksportować tekst PDF do JSON?

JSON przydaje się, gdy przetwarzanie dokumentu wymaga zarówno tekstu, jak i jego położenia. Programista może ocenić jakość ekstrakcji, znaleźć powtarzające się etykiety lub przygotować osobny proces mapowania. Zdefiniuj to mapowanie jednoznacznie: pobliska kwota nie staje się automatycznie sumą faktury, a kolejność ekstrakcji nie musi odpowiadać kolejności czytania przez człowieka.

Kto może korzystać z tego eksportu?

Programiści przetwarzania dokumentów

Sprawdź warstwę tekstową przed zbudowaniem parsera i zachowaj odwołania do stron do diagnozowania błędów.

Zespoły weryfikacji danych

Porównuj przykładowe wartości ze stroną źródłową przed zaakceptowaniem reguły ekstrakcji.

Studenci i badacze

Sprawdź, jak widoczny tekst jest przedstawiony w dokumencie o stałym układzie.

Ustawienia i kontrola wyników

UstawienieOczekiwany rezultat
Dane wejścioweJeden PDF do 25 MiB; maksymalnie 500 stron źródłowych.
WybórMaksymalnie 200 wybranych stron; 20 000 elementów tekstowych na stronę, 100 000 na zadanie i dwa miliony znaków tekstu.
WynikJSON zawierający wyodrębniony tekst i geometrię; maksymalnie 64 MiB.
Zeskanowane stronyBez automatycznego OCR, eksportu obrazów ani rozpoznawania pól dokumentu.

Sprawdź małą próbkę przed budową parsera

W przypadku dwukolumnowego zestawienia najpierw wyeksportuj jedną stronę. Znajdź znaną etykietę i porównaj jej położenie z wydrukowaną wartością. Jeśli elementy obu kolumn są przemieszane, pogrupuj je we własnym kodzie według współrzędnych, zamiast zakładać, że tablica jest już gotową tabelą.

Rozwiązywanie problemów z konwersją PDF na JSON

SytuacjaCo sprawdzić
Nie znaleziono zaznaczalnego tekstuWykonaj OCR zeskanowanych stron, a następnie wyeksportuj powstałą warstwę tekstową PDF.
Tekst pojawia się w nieoczekiwanej kolejnościPorównaj stronę i położenie tekstu; kolejność ekstrakcji nie wyznacza kolejności czytania.
Duży wybór stron zostaje odrzuconyWybierz mniej stron. Strony o gęstej zawartości mogą osiągnąć limit elementów tekstowych przed limitem stron.

Najczęstsze pytania

Czy konwersja PDF na JSON rozpoznaje pola faktury?

Nie. Wynik zawiera elementy tekstowe i geometrię. Nazwy pól, ich relacje i weryfikacja biznesowa wymagają osobnego procesu mapowania.

Czy wynik zawiera obrazy i tabele?

Obrazy nie są eksportowane. Tekst wewnątrz tabeli można wyodrębnić, ale relacje między wierszami i kolumnami nie są odbudowywane.

Czy mogę odtworzyć oryginalny PDF z tego JSON?

Eksport jest formatem do analizy, a nie pełną reprezentacją PDF. Zachowaj oryginał, aby przechować wygląd, grafikę, czcionki i funkcje interaktywne.

Powiązane narzędzia

JSON na PDF, PDF na XML, Rozpoznawanie tekstu w PDF.