PDF in Text

Extrahieren Sie die vorhandene Textebene in eine UTF-8-Textdatei.

Wählen Sie PDF-Dateien

Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.

Bis zu 100 MB insgesamt · Dateien bleiben auf Ihrem Gerät

Inhaltsverzeichnis11 Abschnitte

Was können Sie als reinen Text aus einem PDF extrahieren?

Extrahieren Sie die vorhandene Textebene des PDFs zum Suchen, Kopieren oder Weiterbearbeiten. Zeilen werden anhand ihrer Positionen auf der Seite gruppiert. Das ist besonders hilfreich für textorientierte Berichte und Dokumentarchive.

Die Ausgabe enthält reinen Text ohne Schriften, Bilder oder Seitengestaltung. Die Lesereihenfolge mehrspaltiger Seiten kann vom visuellen Layout abweichen. Eine gescannte Seite ohne Textebene kann durch diesen Vorgang nicht transkribiert werden.

Funktionen für PDF in Text

Vorhandenen Text extrahieren

Lesen Sie die auswählbare Textebene des Dokuments, statt Buchstaben in gescannten Bildern zu erkennen.

Relevante Seiten wählen

Beschränken Sie den Export mithilfe des Felds Seiten auf ein Kapitel, ein Schreiben oder einen Anhang.

Portable TXT-Ausgabe

Laden Sie eine reine Textdatei herunter, die in gewöhnlichen Texteditoren ohne Textverarbeitungslayout geöffnet werden kann.

Positionsbasierte Zeilengruppierung

Nahe beieinanderliegende Textfragmente werden zu Zeilen gruppiert. Die Lesereihenfolge mehrerer Spalten muss weiterhin anhand der Seite geprüft werden.

Warum PDF-Wortlaut in eine Textdatei umwandeln?

Reiner Text ist nützlich, wenn die Wörter wichtiger sind als das gedruckte Layout. Sie können damit einen lokalen Ordner durchsuchen, Wortlaut in einen Editor kopieren oder einen sauberen Ausgangspunkt für Notizen vorbereiten. Außerdem wird vermieden, bildreiche Seitengestaltung in eine Textaufgabe zu übernehmen. Eine Textebene ist nicht immer identisch mit dem scheinbar sichtbaren Wortlaut einer Seite: Ligaturen, verborgene OCR-Fehler und Spaltenreihenfolge können den Export verändern. Prüfen Sie repräsentative Absätze sowie wichtige Namen oder Zahlen, bevor Sie das Ergebnis weiterverwenden.

Wer verwendet extrahierten PDF-Text?

Universitätsforschende

Exportieren Sie den Text eines erlaubten Artikels, um Zitate zu sammeln und Lesenotizen zu erstellen. Gleichen Sie jedes Zitat mit seiner Quellseite ab und notieren Sie die Seitennummer getrennt.

Verwaltungssachbearbeiter

Übernehmen Sie den Wortlaut eines Standardschreibens für einen überarbeiteten Entwurf in einen Texteditor. Prüfen Sie Anreden, Datumsangaben und Zeilenumbrüche, bevor Sie ihn in die Vorlage der Organisation übertragen.

Technische Redakteure

Gewinnen Sie Spezifikationstext für eine durchsuchbare Arbeitsnotiz zurück. Vergleichen Sie Einheiten, Symbole und nummerierte Schritte mit dem PDF, weil ungewöhnliche Schriftkodierungen extrahierte Zeichen verändern können.

Wie extrahieren Sie Text aus einem PDF?

  1. Wählen Sie ein PDF mit auswählbarem Text. Wenn es ein reiner Bildscan ist, erstellen Sie zuerst mit OCR eine Textebene.
  2. Geben Sie die zu extrahierenden Seiten ein oder lassen Sie Seiten für das gesamte Dokument leer. Fügen Sie bei Bedarf einen Downloadnamen hinzu.
  3. Führen Sie die Extraktion aus und laden Sie die TXT-Datei herunter. Öffnen Sie sie in einem Texteditor.
  4. Vergleichen Sie Absatzreihenfolge, Zeichensetzung, Namen und wichtige Zahlen mit dem ursprünglichen PDF, bevor Sie den Text bearbeiten oder zitieren.

Quelldatei auswählen

Wählen Sie ein PDF mit einer vorhandenen auswählbaren Textebene.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in Text, Schritt 1: Wählen Sie ein PDF mit einer vorhandenen auswählbaren Textebene.

Werkzeugeinstellungen prüfen

Wählen Sie die Seiten und bei Bedarf einen Downloadnamen.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in Text, Schritt 2: Wählen Sie die Seiten und bei Bedarf einen Downloadnamen.

Ergebnis herunterladen und prüfen

Laden Sie die TXT-Datei herunter und gleichen Sie ihren Wortlaut mit dem PDF ab.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF in Text, Schritt 3: Laden Sie die TXT-Datei herunter und gleichen Sie ihren Wortlaut mit dem PDF ab.

Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.

Einstellungen und Ergebnisprüfungen

EinstellungWas Sie erwarten können
Akzeptierte EingabePDF
VerarbeitungsortIhr Browser
DateiauswahlEine Eingabedatei
EingabegrößeInsgesamt 100 MB; für dekodierte Bilder und Seiten gelten zusätzlich Pixelgrenzen
SeitenauswahlBis zu 200 ausgewählte Seiten pro Auftrag. Ein leeres Feld Seiten bedeutet nur dann alle Seiten, wenn das PDF höchstens 200 Seiten hat; verwenden Sie für ein längeres Dokument getrennte Bereiche.

Wenn kein Wortlaut ausgewählt werden kann, weil die Seite ein Scan ist, fügen Sie eine OCR-Textebene hinzu und prüfen Sie sie, bevor Sie Textextraktion verwenden.

Lesereihenfolge und kodierte Zeichen prüfen

Textfragmente können im PDF in einer anderen Reihenfolge vorliegen als ihre sichtbaren Positionen. Randspalten, Fußnoten und zweispaltige Layouts sind häufige Gründe, weshalb ein exportierter Satz unterbrochen wird. Der sichtbare Buchstabe kann außerdem von einer Schriftzuordnung abhängen, die der Extraktion nicht dasselbe Zeichen liefert. Vergleichen Sie einen Absatz, der eine Spalten- oder Seitengrenze überschreitet, und prüfen Sie technische Symbole sowie Ligaturen wie „fi“, bevor Sie die TXT-Datei als zuverlässigen Quellwortlaut behandeln.

Probleme bei PDF in Text beheben

SituationWas Sie tun können
Die Textdatei ist leer oder die Umwandlung wird abgewiesenDie ausgewählten Seiten haben möglicherweise keine Textebene. Verwenden Sie zuerst OCR, sofern verfügbar.
Einige Buchstaben sind falschDie Textkodierung oder OCR-Ebene des PDFs kann fehlerhaft sein. Vergleichen Sie Namen, Zahlen und Symbole mit der sichtbaren Seite.
Sie benötigen ein bearbeitbares formatiertes DokumentVerwenden Sie PDF in Word als DOCX-Ausgangspunkt; ein exaktes Layout muss weiterhin geprüft werden.

Ein praktisches Beispiel und abschließende Prüfungen

Stellen Sie sich zwei Spalten mit A1, A2 links und B1, B2 rechts vor. Positionsbasierte Gruppierung kann A1 B1 und danach A2 B2 ergeben und damit die Spalten vermischen. Lesen Sie jede Spalte im PDF, bevor Sie extrahierte Zeilen umordnen; auch eine sauber wirkende Textdatei kann unzusammengehörige Sätze verbinden.

Häufig gestellte Fragen

Kann ich Text aus einem gescannten PDF extrahieren?

Führen Sie zuerst OCR aus, um erkannten Text hinzuzufügen. Die Auswahl einer reinen Bildquelle liefert eine klare Meldung über fehlenden Text.

Erhält das Werkzeug Absätze?

Positionsbasierte Zeilengruppierung nähert die Zeilenreihenfolge an. Absatzumbrüche und komplexe Spalten benötigen redaktionelle Prüfung.

Wie werden Seiten im Textdownload getrennt?

Text der ausgewählten Seiten wird mit Leerzeilen zusammengefügt. Behalten Sie den tatsächlichen Seitenbereich in Ihren Notizen, wenn Sie genaue Rückverweise auf das PDF benötigen.

Weitere Werkzeuge und Anleitungen

Weiter mit PDF-Texterkennung (OCR), PDF-Reader. Lesen Sie für eine Ausgabe in einer anderen Sprache den Ablauf zur PDF-Übersetzung; die Textextraktion selbst übersetzt nicht.