PDF in XML

Extrahieren Sie PDF-Textelemente und Seitengeometrie in eine dokumentierte XML-Struktur.

Wählen Sie PDF-Dateien

Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.

Bis zu 25 MB insgesamt · Dateien bleiben auf Ihrem Gerät

Inhaltsverzeichnis10 Abschnitte

Was enthält der XML-Export?

Exportieren Sie die auswählbare Textebene eines PDFs als XML. Die Datei gruppiert Textelemente unter ihren ursprünglichen Seitennummern und erfasst Seitengeometrie, Textrichtung sowie Positionstransformationen. Sie liefert strukturierte Daten zur Prüfung und späteren Verarbeitung.

Das XML beschreibt, was der PDF-Textleser extrahiert hat. Es ist nicht das ursprüngliche XML, aus dem das Dokument möglicherweise erzeugt wurde, und erkennt keine Rechnungsfelder, rekonstruiert keine Tabellenbeziehungen und exportiert keine Bilder. Reine Bildseiten benötigen zunächst OCR.

Funktionen von PDF in XML

Seitenbezogene Elemente

Behalten Sie Quellseitennummern, Drehung und sichtbare Seitengrenzen zusammen mit dem extrahierten Text bei. Das bewahrt einen nützlichen Bezug beim Prüfen eines ausgewählten Bereichs.

Maskierte Textwerte

Zeichen wie kaufmännisches Und und spitze Klammern bleiben Daten innerhalb der XML-Elemente. Text, der wie Markup aussieht, kann durch diesen Export nicht zu ausführbarem Seiteninhalt werden.

Umkehrbare Sonderzeichenketten

Zeichen, die XML nicht direkt darstellen kann, verwenden eine ausdrücklich gekennzeichnete JSON-Zeichenkettenkodierung. Anhand der Kennzeichnung kann ein empfangendes Programm diese Werte korrekt wiederherstellen.

Verarbeitung im Browser

Erstellen Sie die XML-Datei auf Ihrem Gerät. Die Quelldatei wird weder zur Konvertierung hochgeladen noch neu geschrieben.

Wie extrahiere ich XML aus einem PDF?

  1. Wählen Sie ein unverschlüsseltes PDF mit auswählbarem Text.
  2. Geben Sie die gewünschten Seitennummern oder Bereiche unter Seiten ein.
  3. Konvertieren Sie die Datei und laden Sie das XML-Ergebnis herunter.
  4. Öffnen Sie das XML in einem Texteditor oder einer XML-fähigen Anwendung.
  5. Vergleichen Sie eine bekannte Seite und Formulierung, bevor Sie Elemente einem anderen System zuordnen.

Quell-PDF auswählen

Wählen Sie ein PDF mit lesbarer Textebene.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in XML: Auswahl eines Quell-PDFs.

Seitenbereich begrenzen

Wählen Sie die für den XML-Export benötigten Seiten.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in XML: Seitenbereich und Extraktionsgrenzen.

XML speichern

Laden Sie das XML herunter und prüfen Sie seine Seitenelemente.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in XML: Download des abgeschlossenen XML-Exports.

Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.

Warum XML zur Prüfung von PDF-Text verwenden?

Ein XML-basierter Ablauf benötigt möglicherweise ausdrückliche Seiten- und Textelemente, bevor er eigene Transformationsregeln anwendet. Ein Team kann diese Elemente prüfen, Quellseitenverweise bewahren und eine separate Zuordnung für bekannte Dokumenttypen erstellen. Trennen Sie diese Zuordnung von der Extraktion: Die Nähe zweier Textelemente begründet für sich keine fachliche Beziehung.

Wer kann mit dieser XML-Ausgabe arbeiten?

Integrationsentwickler

Nutzen Sie Seiten- und Textelemente als Eingabe für einen kontrollierten Dokumentenverarbeitungsablauf.

Dokumentenarchivare

Prüfen Sie, ob Text zusätzlich zum aufbewahrten Original-PDF verfügbar bleibt.

Datenprüfer

Vergleichen Sie Stichprobenwerte mit ihren Quellseiten, bevor Sie Transformationsregeln übernehmen.

Einstellungen und Prüfung der Ausgabe

EinstellungWas Sie erwarten können
QuelleEin PDF mit bis zu 25 MiB und höchstens 500 Quellseiten.
SeitenbereichBis zu 200 ausgewählte Seiten. Ein leerer Bereich schließt alle Seiten nur ein, wenn dieses Limit eingehalten wird.
TextgrenzenBis zu 20.000 Elemente je Seite, 100.000 je Auftrag und zwei Millionen Textzeichen.
AusgabedateiEin XML-Dokument mit bis zu 64 MiB. Es wird keine externe DTD und kein externes Schema abgerufen.

Ordnen Sie eine bekannte Beschriftung nach der Seitenprüfung zu

Exportieren Sie bei einem Lieferdokument eine Seite und suchen Sie eine bekannte Referenznummer. Vergleichen Sie ihre Texttransformation und benachbarte Elemente mit der Originalseite. Ihre Anwendung kann danach eine Regel für diesen Dokumenttyp anwenden. Behandeln Sie nicht jede benachbarte Zahl in voneinander unabhängigen Layouts als dasselbe Feld.

Fehlerbehebung bei PDF in XML

SituationWas Sie prüfen sollten
Das XML passt nicht zum Schema eines LieferantenDer Export verwendet eine eigene Extraktionsstruktur. Erstellen Sie eine separate Zuordnung zum Schema, das Ihr Zielsystem erwartet.
Ein Element besitzt ein encoding-AttributWenn encoding den Wert json hat, parsen Sie seinen Text als JSON-Zeichenkette, um Zeichen wiederherzustellen, die nicht direkt in XML stehen können.
Wörter fehlen oder stehen in unerwarteter ReihenfolgePrüfen Sie auf gescannte Seiten oder ungewöhnliche Textplatzierung. Wenden Sie gegebenenfalls OCR an und prüfen Sie die Koordinaten.

Häufige Fragen

Stellt PDF in XML das ursprüngliche Quell-XML wieder her?

Nein. Ein PDF bewahrt das ursprüngliche Datenmodell normalerweise nicht auf. Dieser Export erfasst die Textebene und Geometrie, die der Leser extrahieren kann.

Werden PDF-Tags in ein XML-Dokumentmodell umgewandelt?

Nein. Das Werkzeug rekonstruiert weder die Semantik getaggter PDFs noch Überschriften oder Tabellenstrukturen. Seine Seiten- und Textelemente beschreiben Extraktionsergebnisse.

Kann ich dieses XML wieder in dasselbe PDF umwandeln?

Das Werkzeug XML in PDF kann XML-Quelltext drucken, aber das ursprüngliche Seitenlayout nicht aus dieser Extraktionsdatei nachbilden. Bewahren Sie das Original-PDF auf.

Verwandte Werkzeuge

XML in PDF, PDF in JSON, PDF-OCR.