Seitenauswahl
Exportieren Sie einen bestimmten Seitenbereich unter Beibehaltung der ursprünglichen Seitennummern. So lässt sich eine kleine Stichprobe leichter prüfen, bevor Sie ein längeres Dokument verarbeiten.
Exportieren Sie auswählbaren Text, Seitengeometrie und Textpositionen als JSON.
Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.
Bis zu 25 MB insgesamt · Dateien bleiben auf Ihrem Gerät
Sehen Sie sich hier die Dokumentvorschau an. Verwenden Sie sie beim Hinzufügen von Inhalten als Platzierungshilfe und prüfen Sie die gespeicherte Datei.
Wandeln Sie die Textebene eines PDFs in eine JSON-Datei zur Prüfung oder weiteren Verarbeitung um. Der Export erfasst die ausgewählten Seiten, ihre Abmessungen und die vom PDF-Leser gelieferten Textelemente einschließlich ihrer Positionen und Transformationen.
Ein PDF speichert Anweisungen zur Darstellung einer Seite. Dieses Werkzeug leitet keine Rechnungsfelder ab, rekonstruiert keine Tabellen und erkennt keine ursprünglichen Überschriftenebenen. Gescannte Seiten benötigen OCR, bevor ihre Wörter im Export erscheinen können.
Exportieren Sie einen bestimmten Seitenbereich unter Beibehaltung der ursprünglichen Seitennummern. So lässt sich eine kleine Stichprobe leichter prüfen, bevor Sie ein längeres Dokument verarbeiten.
Bewahren Sie Textelemente zusammen mit Seitengeometrie und Positionsangaben auf. Nutzen Sie das ursprüngliche PDF, um Koordinaten zu interpretieren und die sichtbaren Beziehungen zwischen Elementen zu prüfen.
Laden Sie gültiges JSON für Ihren eigenen Parser oder Prüfablauf herunter. Exportierter Text wird als Daten maskiert; das Werkzeug führt keinen Dokumentinhalt aus.
Lesen Sie das ausgewählte PDF in Ihrem Browser. Ihr Dokument wird nicht an einen Konvertierungsserver gesendet, und die Originaldatei bleibt unverändert.
Wählen Sie ein PDF mit auswählbarem Text.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Legen Sie den Seitenbereich fest und prüfen Sie die Extraktionsgrenzen.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Speichern Sie das JSON und vergleichen Sie es mit der Quellseite.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.
JSON ist nützlich, wenn ein Dokumentenablauf sowohl Text als auch dessen Position benötigt. Entwickler können die Extraktionsqualität prüfen, wiederholte Beschriftungen finden oder eine separate Zuordnung vorbereiten. Diese Zuordnung muss ausdrücklich festgelegt werden: Ein benachbarter Betrag ist nicht automatisch die Rechnungssumme, und die Extraktionsreihenfolge entspricht nicht zwingend der menschlichen Lesereihenfolge.
Prüfen Sie die Textebene vor dem Aufbau eines Parsers und behalten Sie Seitenverweise für die Fehlersuche bei.
Vergleichen Sie Stichprobenwerte mit der Quellseite, bevor Sie eine Extraktionsregel übernehmen.
Untersuchen Sie, wie sichtbarer Text in einem Dokument mit festem Layout dargestellt wird.
| Einstellung | Was Sie erwarten können |
|---|---|
| Eingabe | Ein PDF mit bis zu 25 MiB und bis zu 500 Quellseiten. |
| Auswahl | Bis zu 200 ausgewählte Seiten; bis zu 20.000 Textelemente je Seite, 100.000 je Auftrag und zwei Millionen Textzeichen. |
| Ausgabe | JSON mit extrahiertem Text und Geometrie; höchstens 64 MiB. |
| Gescannte Seiten | Keine automatische OCR, kein Bildexport und keine Erkennung von Dokumentfeldern. |
Exportieren Sie bei einer zweispaltigen Aufstellung zuerst eine Seite. Suchen Sie eine bekannte Beschriftung und vergleichen Sie deren Position mit dem gedruckten Wert. Sind Elemente beider Spalten vermischt, gruppieren Sie sie in Ihrem eigenen Code anhand der Koordinaten, statt das Array bereits als fertige Tabelle zu betrachten.
| Situation | Was Sie prüfen sollten |
|---|---|
| Es wird kein auswählbarer Text gefunden | Führen Sie OCR für gescannte Seiten aus und exportieren Sie anschließend die Textebene des entstandenen PDFs. |
| Text erscheint in unerwarteter Reihenfolge | Vergleichen Sie die Seite und die Textpositionen; die Extraktionsreihenfolge legt keine Lesereihenfolge fest. |
| Eine große Auswahl wird abgelehnt | Wählen Sie weniger Seiten. Dichte Seiten können das Limit für Textelemente vor dem Seitenlimit erreichen. |
Nein. Die Ausgabe enthält Textelemente und Geometrie. Feldnamen, Beziehungen und fachliche Validierung erfordern eine separate Zuordnung.
Bilder werden nicht exportiert. Text innerhalb einer Tabelle kann extrahiert werden, aber Beziehungen zwischen Zeilen und Spalten werden nicht rekonstruiert.
Der Export ist ein Prüfungsformat, keine vollständige PDF-Darstellung. Bewahren Sie das Original-PDF für Darstellung, Grafiken, Schriften und interaktive Funktionen auf.