PDF-Texterkennung (OCR)

Machen Sie Scans durchsuchbar und behalten Sie das ursprüngliche Seitenbild bei.

Wählen Sie PDF-Dateien

Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.

Bis zu 100 MB insgesamt · Dateien bleiben auf Ihrem Gerät

Inhaltsverzeichnis12 Abschnitte

Wann benötigt ein PDF OCR?

Fügen Sie einem gescannten PDF mit Tesseract im Browser eine durchsuchbare Textebene hinzu. Wählen Sie die Sprache der Quelle; Deutsch ist voreingestellt. Unterstützte Reader können erkannte Wörter dann suchen und auswählen, während die gescannte Seite ihr ursprüngliches Erscheinungsbild behält.

Standardmäßig behält der Vorgang Seiten, die bereits Text enthalten. Sie können auch jede ausgewählte Seite erkennen lassen; dadurch wird eine neue Ebene hinzugefügt, und vorhandener Text kann doppelt erscheinen. Die OCR-Genauigkeit hängt von Schärfe, Kontrast, Sprache und Seitenausrichtung ab. Kleingedrucktes, Handschrift, ungewöhnliche Schriften und verrauschte Scans benötigen sorgfältige Prüfung statt automatisches Vertrauen.

Funktionen der PDF-Texterkennung (OCR)

Durchsuchbares PDF oder TXT

Laden Sie erkannten Wortlaut als reinen Text herunter oder legen Sie in einem PDF eine Textebene über das erhaltene Scanbild.

Bis zu 20 ausgewählte Seiten

Der Download enthält nur ausgewählte Seiten. Wählen Sie bis zu 20 Seiten; lassen Sie Seiten nur dann für das ganze Dokument leer, wenn es höchstens 20 Seiten hat.

Einstellungen der Texterkennung

Wählen Sie die Quellsprache, 200 oder 300 DPI, eine Drehung für die Erkennung sowie ein automatisches Layout, einen einzelnen Textblock oder verstreuten Text. Die unterstützten Sprachen stehen in den FAQ unten.

Vorhandenen Text standardmäßig behalten

Seiten, die bereits Text enthalten, können erhalten bleiben. Erzwingen Sie die Erkennung nur, nachdem Sie mögliche doppelte Textebenen berücksichtigt haben.

Warum einem Scan eine durchsuchbare Textebene hinzufügen?

Ein Scan speichert die Seite als Bild, daher kann gewöhnliche Textsuche die darauf gedruckten Wörter nicht finden. OCR in der ausgewählten Sprache kann einen Scan mit Maschinenschrift durchsuchbar machen und Wortlaut zum Kopieren und Einfügen oder für spätere Textextraktion bereitstellen. Das ist besonders für Archive nützlich, in denen das Finden eines bekannten Namens oder einer Formulierung wichtiger ist als die Neugestaltung der Seite. Die erkannte Ebene kann Fehler enthalten, auch wenn der Scan klar aussieht. Testen Sie Suche und Auswahl und vergleichen Sie anschließend Namen, Referenzen und Zahlen mit dem Seitenbild, bevor Sie extrahierten Wortlaut verwenden.

Wer verwendet OCR bei PDF-Scans?

Bibliotheks- und Registraturpersonal

Machen Sie ein kurzes maschinengeschriebenes Dokument nach Titel, Name oder Referenznummer durchsuchbar. Behalten Sie den Originalscan und testen Sie diese Suchbegriffe in der heruntergeladenen Kopie, auch bei leicht verwechselbaren Zeichen.

Studierende mit gescannten Handouts

Machen Sie maschinengeschriebene Kursnotizen durchsuchbar, bevor Sie Lernnotizen erstellen. Handschriftliche Anmerkungen können unzuverlässig bleiben; gleichen Sie daher zitierte Passagen mit dem Scan ab.

Personalverwaltung bei gewöhnlichen Aufgaben

Extrahieren Sie Wortlaut aus einem freigegebenen gescannten Memo für ein internes Verzeichnis. Vergleichen Sie Datumsangaben, Mitarbeiternamen und Referenznummern sorgfältig, weil ein einzelnes erkanntes Zeichen eine Kennung verändern kann.

Wie machen Sie ein gescanntes PDF durchsuchbar?

  1. Wählen Sie einen unverschlüsselten Scan und höchstens 20 Seiten aus. Der PDF-Download enthält nur diese Auswahl. Beginnen Sie mit einer kurzen Probe, wenn Sie diesen Scantyp noch nicht verwendet haben.
  2. Wählen Sie unter Textsprache die Quellsprache. Wählen Sie Durchsuchbares PDF oder Reiner Text, legen Sie die Erkennungsauflösung fest und wählen Sie eine Drehung oder ein Seitenlayout, wenn der Scan dies benötigt.
  3. Behalten Sie vorhandenen Text standardmäßig oder wählen Sie bewusst Jede ausgewählte Seite erkennen. Starten Sie OCR und warten Sie auf den Abschluss der Erkennung.
  4. Laden Sie das Ergebnis herunter. Suchen Sie eine bekannte Formulierung, kopieren Sie eine Zeile und vergleichen Sie Schreibweisen und Zahlen mit dem Originalscan.

Quelldatei auswählen

Wählen Sie einen Scan in einer unterstützten Sprache und bis zu 20 Seiten aus.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF-Texterkennung (OCR), Schritt 1: Wählen Sie einen Scan in einer unterstützten Sprache und bis zu 20 Seiten aus.

Werkzeugeinstellungen prüfen

Wählen Sie Quellsprache, OCR-Ausgabe, Auflösung, Layout und Ausrichtung für die Texterkennung.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF-Texterkennung (OCR), Schritt 2: Wählen Sie Quellsprache, OCR-Ausgabe, Auflösung, Layout und Ausrichtung für die Texterkennung.

Ergebnis herunterladen und prüfen

Laden Sie den erkannten Text herunter und gleichen Sie ihn mit dem Originalscan ab.

Wählen Sie den Screenshot aus, um ihn zu vergrößern.
PDF-Texterkennung (OCR), Schritt 3: Laden Sie den erkannten Text herunter und gleichen Sie ihn mit dem Originalscan ab.

Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.

Eine Checkliste aus reinen Bildern durchsuchbar machen

Die Quellseite ist ein Bild ohne extrahierbaren Text. OCR fügt eine Textebene hinzu und erhält dabei die sichtbare Seitendarstellung. Beide Bilder sehen daher gleich aus; das herunterladbare Ergebnis enthält zusätzlich die erkannten Wörter.

Vorher: Reine Bildseite

Die Textextraktion aus der Quelle lieferte null Zeichen.

Tatsächliche reine Bildcheckliste vor OCR ohne auswählbare Textebene.

Nachher: Gleiche Seite, durchsuchbarer Text

Das Ergebnis enthält alle sechs Beispielzeilen. Seine gerenderten Pixel stimmen bei der geprüften Bildgröße von 1.300 Pixeln mit der Quelle überein.

Tatsächliches durchsuchbares Ergebnis-PDF mit derselben sichtbaren Checkliste und einer neuen Textebene.
Quelltext
0 Zeichen
Ergebnistext
226 Zeichen
Erkennungsprüfung
6 von 6 Beispielzeilen (Leerzeichen normalisiert)
Aus dem Ergebnis extrahierten Text lesen
WORKSHOP-CHECKLISTE 
Bestätigen Sie die Raumbuchung. 
Drucken Sie vierzig Exemplare des Handouts. 
Testen Sie den Projektor vor 09:00 Uhr. 
Speichern Sie die endgültige Anwesenheitsliste. 
Dies ist ein harmloses OCR-Beispiel.

Verwendete Einstellungen: Seite 1; durchsuchbares PDF; Sprache Deutsch; Erkennung mit 200 DPI; einzelner Textblock; ursprüngliche Ausrichtung.

Dieses saubere deutsche Beispiel mit großer Schrift ist kein Genauigkeitsmaßstab für Kleingedrucktes, Handschrift, schiefe Scans oder andere Sprachen. Lesen Sie Namen, Beträge und Datumsangaben in Ihrem eigenen Ergebnis Korrektur.

Geprüft am . Harmlose Beispieldateien, die in der deutschen Oberfläche des Themes 3.8.0 mit einem lokalen Chromium-Browser verarbeitet wurden. Diese Beispiele sind kein Leistungsmaßstab für Live-Hosting.

Einstellungen und Ergebnisprüfungen

EinstellungWas Sie erwarten können
Akzeptierte EingabePDF
VerarbeitungsortIhr Browser auf Ihrem Gerät
DateiauswahlEine Eingabedatei
EingabegrößeBis zu 100 MB, abhängig von Gerätespeicher und Grenzen für dekodierte Seiten
ErkennungsstapelBis zu 20 ausgewählte Seiten; nur diese Seiten erscheinen im Download des durchsuchbaren PDFs.

Das Werkzeug fügt eine Textebene hinzu; es rekonstruiert keine Tabellen als bearbeitbare Tabellenkalkulation und korrigiert keine sachlichen Inhalte. OCR ersetzt nicht die Prüfung von Namen, Kontonummern und anderem Text, bei dem Präzision entscheidend ist.

Die Erkennungsausrichtung prüfen, ohne den Scan zu verändern

Die Drehungseinstellung dreht den gerenderten Scan, der an die Erkennung übergeben wird; das durchsuchbare PDF behält die sichtbare Darstellung der Quellseite. Sie ersetzt PDF drehen nicht, wenn Leser die Seite aufrecht sehen sollen. Wenn eine vorhandene Textebene Fehler enthält, kann erzwungene Erkennung eine weitere Ebene hinzufügen und doppelte Suchergebnisse erzeugen. Reine Text-OCR kann in dieser Situation eine nützliche geprüfte Extraktion sein. Vergleichen Sie leicht verwechselbare Zeichen wie 0/O, 1/l und Dezimaltrennzeichen mit dem Bild.

Probleme bei der PDF-Texterkennung beheben

SituationWas Sie tun können
Ein Name oder eine Zahl ist falschVergleichen Sie den erkannten Text mit dem Bild. Korrigieren Sie ihn vor der Wiederverwendung in einem geeigneten nachgelagerten Editor.
Eine vorhandene fehlerhafte OCR-Ebene hat sich nicht verbessertWählen Sie Jede ausgewählte Seite erkennen, um eine neue Ebene hinzuzufügen. Vorhandener Text bleibt erhalten, daher kann eine bestehende Ebene doppelte Suchergebnisse erzeugen; exportieren Sie reinen Text, wenn Sie eine saubere Extraktion benötigen.
Ein langes Paket wird abgewiesenTeilen Sie es in Gruppen mit höchstens 20 Seiten, führen Sie für jede Gruppe OCR aus und prüfen Sie sie vor dem Zusammenführen.

Ein praktisches Beispiel und abschließende Prüfungen

Suchen Sie bei einem maschinengeschriebenen Inspektionsblatt eine bekannte Gerätekennung im durchsuchbaren PDF und kopieren Sie diese Kennung sowie einen Messwert in einen Texteditor. Vergleichen Sie beide mit dem Scan und bestätigen Sie, dass die Auswahl die vorgesehene Zeile markiert. Eine erfolgreiche Wortsuche allein belegt weder eine korrekte Lesereihenfolge noch eine zuverlässige Zahlenextraktion.

Häufig gestellte Fragen

Wandelt OCR die Seite in bearbeitbaren Word-Inhalt um?

Die Ausgabe bleibt ein PDF mit hinzugefügter Textebene. Verwenden Sie anschließend PDF in Word, wenn ein Textdokument mit neuem Umbruch benötigt wird.

Welche Sprachen sind verfügbar?

Diese Version enthält Erkennungsmodelle für Englisch, Spanisch, Portugiesisch, Deutsch, Indonesisch, Russisch, Französisch, Italienisch, Türkisch, Arabisch, vereinfachtes Chinesisch, Japanisch, Koreanisch, Polnisch und Hindi. Deutsch ist die Standardeinstellung; wählen Sie die zur Quelle passende Sprache. OCR erkennt Zeichen, übersetzt das Dokument jedoch nicht. Andere Sprachen benötigen einen separat eingerichteten OCR-Ablauf.

Warum wurde eine Seite übersprungen?

Die Standardeinstellung behält Seiten mit vorhandener Textebene. Wählen Sie Jede ausgewählte Seite erkennen, um auch auf ihnen die Erkennung auszuführen.

Enthält die Ausgabe Seiten, die ich nicht ausgewählt habe?

Nein. Das durchsuchbare PDF enthält nur ausgewählte Seiten. Um ein langes Dokument zusammenzuhalten, erkennen Sie Stapel mit bis zu 20 Seiten und kombinieren Sie die geprüften Ausgaben in ihrer ursprünglichen Reihenfolge.

Dreht die Erkennungsdrehung die sichtbare PDF-Seite?

Nein. Sie dreht das der Erkennung übergebene Bild und erhält zugleich die sichtbare Darstellung der Quellseite im PDF. Verwenden Sie zuerst PDF drehen, wenn die gespeicherte Seite selbst aufrecht erscheinen soll.

Kann dieses Werkzeug Handschrift zuverlässig lesen oder Tabellen rekonstruieren?

Das Werkzeug erkennt Text in der ausgewählten Sprache. Es verspricht keine zuverlässige Handschrifterkennung und rekonstruiert keine Tabellenzellen. Verwenden Sie einen scharfen, aufrechten Scan von gedrucktem Text und prüfen Sie den Wortlaut, bevor Sie ihn in Word oder einer Tabellenkalkulation weiterverarbeiten.

Weitere Werkzeuge und Anleitungen

Weiter mit PDF in Word, PDF in Text, Scan in PDF. Für Anforderungen an langfristige Speicherung siehe PDF in PDF/A; ein durchsuchbares PDF ist nicht automatisch PDF/A.