PDF in JSON

Exportieren Sie auswählbaren Text, Seitengeometrie und Textpositionen als JSON.

Wählen Sie PDF-Dateien

Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.

Bis zu 25 MB insgesamt · Dateien bleiben auf Ihrem Gerät

Inhaltsverzeichnis10 Abschnitte

Was lässt sich aus einem PDF in JSON extrahieren?

Wandeln Sie die Textebene eines PDFs in eine JSON-Datei zur Prüfung oder weiteren Verarbeitung um. Der Export erfasst die ausgewählten Seiten, ihre Abmessungen und die vom PDF-Leser gelieferten Textelemente einschließlich ihrer Positionen und Transformationen.

Ein PDF speichert Anweisungen zur Darstellung einer Seite. Dieses Werkzeug leitet keine Rechnungsfelder ab, rekonstruiert keine Tabellen und erkennt keine ursprünglichen Überschriftenebenen. Gescannte Seiten benötigen OCR, bevor ihre Wörter im Export erscheinen können.

Funktionen von PDF in JSON

Seitenauswahl

Exportieren Sie einen bestimmten Seitenbereich unter Beibehaltung der ursprünglichen Seitennummern. So lässt sich eine kleine Stichprobe leichter prüfen, bevor Sie ein längeres Dokument verarbeiten.

Text mit Koordinaten

Bewahren Sie Textelemente zusammen mit Seitengeometrie und Positionsangaben auf. Nutzen Sie das ursprüngliche PDF, um Koordinaten zu interpretieren und die sichtbaren Beziehungen zwischen Elementen zu prüfen.

Maschinenlesbare Ausgabe

Laden Sie gültiges JSON für Ihren eigenen Parser oder Prüfablauf herunter. Exportierter Text wird als Daten maskiert; das Werkzeug führt keinen Dokumentinhalt aus.

Lokale Verarbeitung

Lesen Sie das ausgewählte PDF in Ihrem Browser. Ihr Dokument wird nicht an einen Konvertierungsserver gesendet, und die Originaldatei bleibt unverändert.

Wie wandle ich PDF-Text in JSON um?

  1. Wählen Sie ein unverschlüsseltes PDF, dessen Text sich in einem PDF-Leseprogramm auswählen lässt.
  2. Geben Sie Seitenzahlen wie 1, 3-5 ein oder lassen Sie Seiten leer, um alle zulässigen Seiten einzubeziehen.
  3. Starten Sie die Konvertierung und laden Sie die JSON-Datei herunter.
  4. Öffnen Sie sie in einem JSON-Betrachter oder Editor und vergleichen Sie eine bekannte Formulierung mit der entsprechenden PDF-Seite.
  5. Prüfen Sie Koordinaten, Lesereihenfolge und mögliche leere Seiten, bevor Sie die Daten in einer anderen Anwendung verwenden.

PDF auswählen

Wählen Sie ein PDF mit auswählbarem Text.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in JSON: Auswahl eines Beispiel-PDFs mit Textebene.

Seiten auswählen

Legen Sie den Seitenbereich fest und prüfen Sie die Extraktionsgrenzen.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in JSON: Seitenauswahl und Extraktionseinstellungen.

JSON herunterladen

Speichern Sie das JSON und vergleichen Sie es mit der Quellseite.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in JSON: Download des abgeschlossenen strukturierten Textexports.

Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.

Warum PDF-Text als JSON exportieren?

JSON ist nützlich, wenn ein Dokumentenablauf sowohl Text als auch dessen Position benötigt. Entwickler können die Extraktionsqualität prüfen, wiederholte Beschriftungen finden oder eine separate Zuordnung vorbereiten. Diese Zuordnung muss ausdrücklich festgelegt werden: Ein benachbarter Betrag ist nicht automatisch die Rechnungssumme, und die Extraktionsreihenfolge entspricht nicht zwingend der menschlichen Lesereihenfolge.

Wer kann diesen Export nutzen?

Entwickler von Dokumentenlösungen

Prüfen Sie die Textebene vor dem Aufbau eines Parsers und behalten Sie Seitenverweise für die Fehlersuche bei.

Teams zur Datenprüfung

Vergleichen Sie Stichprobenwerte mit der Quellseite, bevor Sie eine Extraktionsregel übernehmen.

Studierende und Forschende

Untersuchen Sie, wie sichtbarer Text in einem Dokument mit festem Layout dargestellt wird.

Einstellungen und Prüfung der Ausgabe

EinstellungWas Sie erwarten können
EingabeEin PDF mit bis zu 25 MiB und bis zu 500 Quellseiten.
AuswahlBis zu 200 ausgewählte Seiten; bis zu 20.000 Textelemente je Seite, 100.000 je Auftrag und zwei Millionen Textzeichen.
AusgabeJSON mit extrahiertem Text und Geometrie; höchstens 64 MiB.
Gescannte SeitenKeine automatische OCR, kein Bildexport und keine Erkennung von Dokumentfeldern.

Prüfen Sie vor dem Parseraufbau eine kleine Stichprobe

Exportieren Sie bei einer zweispaltigen Aufstellung zuerst eine Seite. Suchen Sie eine bekannte Beschriftung und vergleichen Sie deren Position mit dem gedruckten Wert. Sind Elemente beider Spalten vermischt, gruppieren Sie sie in Ihrem eigenen Code anhand der Koordinaten, statt das Array bereits als fertige Tabelle zu betrachten.

Fehlerbehebung bei PDF in JSON

SituationWas Sie prüfen sollten
Es wird kein auswählbarer Text gefundenFühren Sie OCR für gescannte Seiten aus und exportieren Sie anschließend die Textebene des entstandenen PDFs.
Text erscheint in unerwarteter ReihenfolgeVergleichen Sie die Seite und die Textpositionen; die Extraktionsreihenfolge legt keine Lesereihenfolge fest.
Eine große Auswahl wird abgelehntWählen Sie weniger Seiten. Dichte Seiten können das Limit für Textelemente vor dem Seitenlimit erreichen.

Häufige Fragen

Erkennt PDF in JSON Rechnungsfelder?

Nein. Die Ausgabe enthält Textelemente und Geometrie. Feldnamen, Beziehungen und fachliche Validierung erfordern eine separate Zuordnung.

Sind Bilder und Tabellen enthalten?

Bilder werden nicht exportiert. Text innerhalb einer Tabelle kann extrahiert werden, aber Beziehungen zwischen Zeilen und Spalten werden nicht rekonstruiert.

Kann ich das ursprüngliche PDF aus diesem JSON wiederherstellen?

Der Export ist ein Prüfungsformat, keine vollständige PDF-Darstellung. Bewahren Sie das Original-PDF für Darstellung, Grafiken, Schriften und interaktive Funktionen auf.

Verwandte Werkzeuge

JSON in PDF, PDF in XML, PDF-OCR.