Textskalare in Anführungszeichen
Behalten Sie Wörter wie yes, Datumsangaben, Satzzeichen und Formulierungen mit Doppelpunkten als Zeichenkettenwerte bei. Extrahierter Text wird nicht zu YAML-Anweisungen oder benutzerdefinierten Objekttags.
Exportieren Sie PDF-Textelemente und ihre Seitenpositionen als YAML-Daten.
Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.
Bis zu 25 MB insgesamt · Dateien bleiben auf Ihrem Gerät
Sehen Sie sich hier die Dokumentvorschau an. Verwenden Sie sie beim Hinzufügen von Inhalten als Platzierungshilfe und prüfen Sie die gespeicherte Datei.
Erstellen Sie eine YAML-Datei mit Textelementen aus ausgewählten PDF-Seiten. Das Ergebnis enthält Quellseitenverweise, Seitengeometrie und Textpositionstransformationen und lässt sich in einem Texteditor oder einem separaten Verarbeitungsablauf prüfen.
Der Export interpretiert das Dokument nicht als Anwendungskonfiguration. Er leitet keine Überschriftenebenen ab, extrahiert keine Bilder, erkennt keine Rechnungsfelder und baut keine Tabelle anhand ihrer Darstellung nach. Der Text folgt der Extraktionsreihenfolge des PDF-Lesers, die von der Lesereihenfolge abweichen kann.
Behalten Sie Wörter wie yes, Datumsangaben, Satzzeichen und Formulierungen mit Doppelpunkten als Zeichenkettenwerte bei. Extrahierter Text wird nicht zu YAML-Anweisungen oder benutzerdefinierten Objekttags.
Ausgewählte Seiten behalten ihre Quellnummern. Prüfer können zur entsprechenden PDF-Seite zurückkehren, ohne Arraypositionen in der Ausgabe abzuzählen.
Speichern Sie Texttransformationen, Richtung und Seitenabmessungen zusammen mit den Wörtern. Eine nachgelagerte Verarbeitung kann Positionen untersuchen, statt eine fertige Tabelle vorauszusetzen.
Die Ausgabe erklärt, dass keine semantische Rekonstruktion und keine OCR stattgefunden haben. Dadurch kann ein anderes Programm das Ergebnis als extrahierte Daten behandeln.
Wählen Sie ein PDF mit dem zu prüfenden Text.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Beginnen Sie mit einer kleinen Auswahl von Quellseiten.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Speichern Sie die Ausgabe und prüfen Sie die Textwerte in Anführungszeichen.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.
YAML kann für textbasierte Prüfungen praktisch sein, wenn ein Team strukturierte Seiteninformationen ohne separaten Betrachter benötigt. Nutzen Sie den Export als Dokumentdaten und prüfen Sie ihn vor einem Import nach Ihren eigenen Regeln. Eine PDF-Aufstellung darf nicht allein dadurch zu vertrauenswürdiger Konfiguration werden, dass ihre Wörter in einer YAML-Datei stehen.
Prüfen Sie Text und Seitenverweise, bevor Sie Extraktionsregeln für ein bekanntes Dokumentenlayout entwickeln.
Bewahren Sie ein lesbares Zwischenergebnis auf, während Sie ausgewählte Zitate und ihre Seitenpositionen prüfen.
Vergleichen Sie Änderungen in extrahierten Dokumentdaten mit Werkzeugen für strukturierte Textdateien.
| Einstellung | Was Sie erwarten können |
|---|---|
| Eingabedatei | Ein PDF mit bis zu 25 MiB und 500 Quellseiten. |
| Ausgewählte Seiten | Bis zu 200 Seiten in der eingegebenen Reihenfolge; wiederholte Seitenverweise erscheinen einmal. |
| Extraktionsgrenzen | 20.000 Elemente je Seite, 100.000 je Auftrag und zwei Millionen Textzeichen. |
| YAML-Ausgabe | Deklariertes YAML 1.2 mit Zeichenkettenwerten in Anführungszeichen; höchstens 64 MiB Downloadgröße. |
Ein Formular kann neben einer Beschriftung das gedruckte Wort yes und eine Zahl mit führenden Nullen enthalten. Prüfen Sie diese extrahierten Zeichenketten im YAML und vergleichen Sie sie mit der Quelle. Der Export behält Text als Werte in Anführungszeichen bei, sodass Ihre Anwendung entscheiden kann, ob ein Wert eine Beschriftung, Kennung, ein Datum oder etwas anderes ist.
| Situation | Was Sie prüfen sollten |
|---|---|
| Der Text enthält Unicode-Escape-Sequenzen | Ein YAML-Parser kann die ursprünglichen Zeichen aus den maskierten Zeichenketten wiederherstellen. So verhindern auch Steuerzeichen keine korrekte Dateistruktur. |
| Die Ausgabe ist keine direkt importierbare Konfiguration | Sie ist ein Extraktionsdatensatz. Ordnen Sie die von Ihrer Anwendung benötigten Felder separat zu und validieren Sie sie. |
| Die Auswahl ist zu dicht | Verkleinern Sie den Seitenbereich. Eine dichte Seite kann das Limit für Textelemente oder Zeichen vor dem Seitenlimit erreichen. |
Nein. Es liest ein PDF und erzeugt YAML-Ausgabe. Es lädt kein hochgeladenes YAML, führt keine Tags aus und übernimmt keine Konfigurationseinstellungen.
Es findet keine automatische OCR statt. Führen Sie zuerst OCR für ein reines Bild-PDF aus und prüfen Sie den erkannten Text vor dem Export.
Nicht unbedingt. Mehrspaltige Seiten und positionierte Beschriftungen können eine andere Extraktionsreihenfolge ergeben. Prüfen Sie ihre Koordinaten und die Originalseite.