Seitenbezogene Elemente
Behalten Sie Quellseitennummern, Drehung und sichtbare Seitengrenzen zusammen mit dem extrahierten Text bei. Das bewahrt einen nützlichen Bezug beim Prüfen eines ausgewählten Bereichs.
Extrahieren Sie PDF-Textelemente und Seitengeometrie in eine dokumentierte XML-Struktur.
Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.
Bis zu 25 MB insgesamt · Dateien bleiben auf Ihrem Gerät
Sehen Sie sich hier die Dokumentvorschau an. Verwenden Sie sie beim Hinzufügen von Inhalten als Platzierungshilfe und prüfen Sie die gespeicherte Datei.
Exportieren Sie die auswählbare Textebene eines PDFs als XML. Die Datei gruppiert Textelemente unter ihren ursprünglichen Seitennummern und erfasst Seitengeometrie, Textrichtung sowie Positionstransformationen. Sie liefert strukturierte Daten zur Prüfung und späteren Verarbeitung.
Das XML beschreibt, was der PDF-Textleser extrahiert hat. Es ist nicht das ursprüngliche XML, aus dem das Dokument möglicherweise erzeugt wurde, und erkennt keine Rechnungsfelder, rekonstruiert keine Tabellenbeziehungen und exportiert keine Bilder. Reine Bildseiten benötigen zunächst OCR.
Behalten Sie Quellseitennummern, Drehung und sichtbare Seitengrenzen zusammen mit dem extrahierten Text bei. Das bewahrt einen nützlichen Bezug beim Prüfen eines ausgewählten Bereichs.
Zeichen wie kaufmännisches Und und spitze Klammern bleiben Daten innerhalb der XML-Elemente. Text, der wie Markup aussieht, kann durch diesen Export nicht zu ausführbarem Seiteninhalt werden.
Zeichen, die XML nicht direkt darstellen kann, verwenden eine ausdrücklich gekennzeichnete JSON-Zeichenkettenkodierung. Anhand der Kennzeichnung kann ein empfangendes Programm diese Werte korrekt wiederherstellen.
Erstellen Sie die XML-Datei auf Ihrem Gerät. Die Quelldatei wird weder zur Konvertierung hochgeladen noch neu geschrieben.
Wählen Sie ein PDF mit lesbarer Textebene.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Wählen Sie die für den XML-Export benötigten Seiten.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Laden Sie das XML herunter und prüfen Sie seine Seitenelemente.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.
Ein XML-basierter Ablauf benötigt möglicherweise ausdrückliche Seiten- und Textelemente, bevor er eigene Transformationsregeln anwendet. Ein Team kann diese Elemente prüfen, Quellseitenverweise bewahren und eine separate Zuordnung für bekannte Dokumenttypen erstellen. Trennen Sie diese Zuordnung von der Extraktion: Die Nähe zweier Textelemente begründet für sich keine fachliche Beziehung.
Nutzen Sie Seiten- und Textelemente als Eingabe für einen kontrollierten Dokumentenverarbeitungsablauf.
Prüfen Sie, ob Text zusätzlich zum aufbewahrten Original-PDF verfügbar bleibt.
Vergleichen Sie Stichprobenwerte mit ihren Quellseiten, bevor Sie Transformationsregeln übernehmen.
| Einstellung | Was Sie erwarten können |
|---|---|
| Quelle | Ein PDF mit bis zu 25 MiB und höchstens 500 Quellseiten. |
| Seitenbereich | Bis zu 200 ausgewählte Seiten. Ein leerer Bereich schließt alle Seiten nur ein, wenn dieses Limit eingehalten wird. |
| Textgrenzen | Bis zu 20.000 Elemente je Seite, 100.000 je Auftrag und zwei Millionen Textzeichen. |
| Ausgabedatei | Ein XML-Dokument mit bis zu 64 MiB. Es wird keine externe DTD und kein externes Schema abgerufen. |
Exportieren Sie bei einem Lieferdokument eine Seite und suchen Sie eine bekannte Referenznummer. Vergleichen Sie ihre Texttransformation und benachbarte Elemente mit der Originalseite. Ihre Anwendung kann danach eine Regel für diesen Dokumenttyp anwenden. Behandeln Sie nicht jede benachbarte Zahl in voneinander unabhängigen Layouts als dasselbe Feld.
| Situation | Was Sie prüfen sollten |
|---|---|
| Das XML passt nicht zum Schema eines Lieferanten | Der Export verwendet eine eigene Extraktionsstruktur. Erstellen Sie eine separate Zuordnung zum Schema, das Ihr Zielsystem erwartet. |
| Ein Element besitzt ein encoding-Attribut | Wenn encoding den Wert json hat, parsen Sie seinen Text als JSON-Zeichenkette, um Zeichen wiederherzustellen, die nicht direkt in XML stehen können. |
| Wörter fehlen oder stehen in unerwarteter Reihenfolge | Prüfen Sie auf gescannte Seiten oder ungewöhnliche Textplatzierung. Wenden Sie gegebenenfalls OCR an und prüfen Sie die Koordinaten. |
Nein. Ein PDF bewahrt das ursprüngliche Datenmodell normalerweise nicht auf. Dieser Export erfasst die Textebene und Geometrie, die der Leser extrahieren kann.
Nein. Das Werkzeug rekonstruiert weder die Semantik getaggter PDFs noch Überschriften oder Tabellenstrukturen. Seine Seiten- und Textelemente beschreiben Extraktionsergebnisse.
Das Werkzeug XML in PDF kann XML-Quelltext drucken, aber das ursprüngliche Seitenlayout nicht aus dieser Extraktionsdatei nachbilden. Bewahren Sie das Original-PDF auf.