Vorhandenen Text extrahieren
Lesen Sie die auswählbare Textebene des Dokuments, statt Buchstaben in gescannten Bildern zu erkennen.
Extrahieren Sie die vorhandene Textebene in eine UTF-8-Textdatei.
Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.
Bis zu 100 MB insgesamt · Dateien bleiben auf Ihrem Gerät
Sehen Sie sich hier die Dokumentvorschau an. Verwenden Sie sie beim Hinzufügen von Inhalten als Platzierungshilfe und prüfen Sie die gespeicherte Datei.
Extrahieren Sie die vorhandene Textebene des PDFs zum Suchen, Kopieren oder Weiterbearbeiten. Zeilen werden anhand ihrer Positionen auf der Seite gruppiert. Das ist besonders hilfreich für textorientierte Berichte und Dokumentarchive.
Die Ausgabe enthält reinen Text ohne Schriften, Bilder oder Seitengestaltung. Die Lesereihenfolge mehrspaltiger Seiten kann vom visuellen Layout abweichen. Eine gescannte Seite ohne Textebene kann durch diesen Vorgang nicht transkribiert werden.
Lesen Sie die auswählbare Textebene des Dokuments, statt Buchstaben in gescannten Bildern zu erkennen.
Beschränken Sie den Export mithilfe des Felds Seiten auf ein Kapitel, ein Schreiben oder einen Anhang.
Laden Sie eine reine Textdatei herunter, die in gewöhnlichen Texteditoren ohne Textverarbeitungslayout geöffnet werden kann.
Nahe beieinanderliegende Textfragmente werden zu Zeilen gruppiert. Die Lesereihenfolge mehrerer Spalten muss weiterhin anhand der Seite geprüft werden.
Reiner Text ist nützlich, wenn die Wörter wichtiger sind als das gedruckte Layout. Sie können damit einen lokalen Ordner durchsuchen, Wortlaut in einen Editor kopieren oder einen sauberen Ausgangspunkt für Notizen vorbereiten. Außerdem wird vermieden, bildreiche Seitengestaltung in eine Textaufgabe zu übernehmen. Eine Textebene ist nicht immer identisch mit dem scheinbar sichtbaren Wortlaut einer Seite: Ligaturen, verborgene OCR-Fehler und Spaltenreihenfolge können den Export verändern. Prüfen Sie repräsentative Absätze sowie wichtige Namen oder Zahlen, bevor Sie das Ergebnis weiterverwenden.
Exportieren Sie den Text eines erlaubten Artikels, um Zitate zu sammeln und Lesenotizen zu erstellen. Gleichen Sie jedes Zitat mit seiner Quellseite ab und notieren Sie die Seitennummer getrennt.
Übernehmen Sie den Wortlaut eines Standardschreibens für einen überarbeiteten Entwurf in einen Texteditor. Prüfen Sie Anreden, Datumsangaben und Zeilenumbrüche, bevor Sie ihn in die Vorlage der Organisation übertragen.
Gewinnen Sie Spezifikationstext für eine durchsuchbare Arbeitsnotiz zurück. Vergleichen Sie Einheiten, Symbole und nummerierte Schritte mit dem PDF, weil ungewöhnliche Schriftkodierungen extrahierte Zeichen verändern können.
Wählen Sie ein PDF mit einer vorhandenen auswählbaren Textebene.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Wählen Sie die Seiten und bei Bedarf einen Downloadnamen.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Laden Sie die TXT-Datei herunter und gleichen Sie ihren Wortlaut mit dem PDF ab.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.
| Einstellung | Was Sie erwarten können |
|---|---|
| Akzeptierte Eingabe | |
| Verarbeitungsort | Ihr Browser |
| Dateiauswahl | Eine Eingabedatei |
| Eingabegröße | Insgesamt 100 MB; für dekodierte Bilder und Seiten gelten zusätzlich Pixelgrenzen |
| Seitenauswahl | Bis zu 200 ausgewählte Seiten pro Auftrag. Ein leeres Feld Seiten bedeutet nur dann alle Seiten, wenn das PDF höchstens 200 Seiten hat; verwenden Sie für ein längeres Dokument getrennte Bereiche. |
Wenn kein Wortlaut ausgewählt werden kann, weil die Seite ein Scan ist, fügen Sie eine OCR-Textebene hinzu und prüfen Sie sie, bevor Sie Textextraktion verwenden.
Textfragmente können im PDF in einer anderen Reihenfolge vorliegen als ihre sichtbaren Positionen. Randspalten, Fußnoten und zweispaltige Layouts sind häufige Gründe, weshalb ein exportierter Satz unterbrochen wird. Der sichtbare Buchstabe kann außerdem von einer Schriftzuordnung abhängen, die der Extraktion nicht dasselbe Zeichen liefert. Vergleichen Sie einen Absatz, der eine Spalten- oder Seitengrenze überschreitet, und prüfen Sie technische Symbole sowie Ligaturen wie „fi“, bevor Sie die TXT-Datei als zuverlässigen Quellwortlaut behandeln.
| Situation | Was Sie tun können |
|---|---|
| Die Textdatei ist leer oder die Umwandlung wird abgewiesen | Die ausgewählten Seiten haben möglicherweise keine Textebene. Verwenden Sie zuerst OCR, sofern verfügbar. |
| Einige Buchstaben sind falsch | Die Textkodierung oder OCR-Ebene des PDFs kann fehlerhaft sein. Vergleichen Sie Namen, Zahlen und Symbole mit der sichtbaren Seite. |
| Sie benötigen ein bearbeitbares formatiertes Dokument | Verwenden Sie PDF in Word als DOCX-Ausgangspunkt; ein exaktes Layout muss weiterhin geprüft werden. |
Stellen Sie sich zwei Spalten mit A1, A2 links und B1, B2 rechts vor. Positionsbasierte Gruppierung kann A1 B1 und danach A2 B2 ergeben und damit die Spalten vermischen. Lesen Sie jede Spalte im PDF, bevor Sie extrahierte Zeilen umordnen; auch eine sauber wirkende Textdatei kann unzusammengehörige Sätze verbinden.
Führen Sie zuerst OCR aus, um erkannten Text hinzuzufügen. Die Auswahl einer reinen Bildquelle liefert eine klare Meldung über fehlenden Text.
Positionsbasierte Zeilengruppierung nähert die Zeilenreihenfolge an. Absatzumbrüche und komplexe Spalten benötigen redaktionelle Prüfung.
Text der ausgewählten Seiten wird mit Leerzeilen zusammengefügt. Behalten Sie den tatsächlichen Seitenbereich in Ihren Notizen, wenn Sie genaue Rückverweise auf das PDF benötigen.
Weiter mit PDF-Texterkennung (OCR), PDF-Reader. Lesen Sie für eine Ausgabe in einer anderen Sprache den Ablauf zur PDF-Übersetzung; die Textextraktion selbst übersetzt nicht.