Durchsuchbares PDF oder TXT
Laden Sie erkannten Wortlaut als reinen Text herunter oder legen Sie in einem PDF eine Textebene über das erhaltene Scanbild.
Machen Sie Scans durchsuchbar und behalten Sie das ursprüngliche Seitenbild bei.
Ziehen Sie Ihre Dateien hierher oder verwenden Sie die Schaltfläche unten.
Bis zu 100 MB insgesamt · Dateien bleiben auf Ihrem Gerät
Sehen Sie sich hier die Dokumentvorschau an. Verwenden Sie sie beim Hinzufügen von Inhalten als Platzierungshilfe und prüfen Sie die gespeicherte Datei.
Fügen Sie einem gescannten PDF mit Tesseract im Browser eine durchsuchbare Textebene hinzu. Wählen Sie die Sprache der Quelle; Deutsch ist voreingestellt. Unterstützte Reader können erkannte Wörter dann suchen und auswählen, während die gescannte Seite ihr ursprüngliches Erscheinungsbild behält.
Standardmäßig behält der Vorgang Seiten, die bereits Text enthalten. Sie können auch jede ausgewählte Seite erkennen lassen; dadurch wird eine neue Ebene hinzugefügt, und vorhandener Text kann doppelt erscheinen. Die OCR-Genauigkeit hängt von Schärfe, Kontrast, Sprache und Seitenausrichtung ab. Kleingedrucktes, Handschrift, ungewöhnliche Schriften und verrauschte Scans benötigen sorgfältige Prüfung statt automatisches Vertrauen.
Laden Sie erkannten Wortlaut als reinen Text herunter oder legen Sie in einem PDF eine Textebene über das erhaltene Scanbild.
Der Download enthält nur ausgewählte Seiten. Wählen Sie bis zu 20 Seiten; lassen Sie Seiten nur dann für das ganze Dokument leer, wenn es höchstens 20 Seiten hat.
Wählen Sie die Quellsprache, 200 oder 300 DPI, eine Drehung für die Erkennung sowie ein automatisches Layout, einen einzelnen Textblock oder verstreuten Text. Die unterstützten Sprachen stehen in den FAQ unten.
Seiten, die bereits Text enthalten, können erhalten bleiben. Erzwingen Sie die Erkennung nur, nachdem Sie mögliche doppelte Textebenen berücksichtigt haben.
Ein Scan speichert die Seite als Bild, daher kann gewöhnliche Textsuche die darauf gedruckten Wörter nicht finden. OCR in der ausgewählten Sprache kann einen Scan mit Maschinenschrift durchsuchbar machen und Wortlaut zum Kopieren und Einfügen oder für spätere Textextraktion bereitstellen. Das ist besonders für Archive nützlich, in denen das Finden eines bekannten Namens oder einer Formulierung wichtiger ist als die Neugestaltung der Seite. Die erkannte Ebene kann Fehler enthalten, auch wenn der Scan klar aussieht. Testen Sie Suche und Auswahl und vergleichen Sie anschließend Namen, Referenzen und Zahlen mit dem Seitenbild, bevor Sie extrahierten Wortlaut verwenden.
Machen Sie ein kurzes maschinengeschriebenes Dokument nach Titel, Name oder Referenznummer durchsuchbar. Behalten Sie den Originalscan und testen Sie diese Suchbegriffe in der heruntergeladenen Kopie, auch bei leicht verwechselbaren Zeichen.
Machen Sie maschinengeschriebene Kursnotizen durchsuchbar, bevor Sie Lernnotizen erstellen. Handschriftliche Anmerkungen können unzuverlässig bleiben; gleichen Sie daher zitierte Passagen mit dem Scan ab.
Extrahieren Sie Wortlaut aus einem freigegebenen gescannten Memo für ein internes Verzeichnis. Vergleichen Sie Datumsangaben, Mitarbeiternamen und Referenznummern sorgfältig, weil ein einzelnes erkanntes Zeichen eine Kennung verändern kann.
Wählen Sie einen Scan in einer unterstützten Sprache und bis zu 20 Seiten aus.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Wählen Sie Quellsprache, OCR-Ausgabe, Auflösung, Layout und Ausrichtung für die Texterkennung.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Laden Sie den erkannten Text herunter und gleichen Sie ihn mit dem Originalscan ab.
Wählen Sie den Screenshot aus, um ihn zu vergrößern.
Die Screenshots zeigen diese Werkzeuge mit Beispieldateien ohne vertrauliche Daten. Ihr Dateiname, die Seitenzahl und die Einstellungen können abweichen.
Die Quellseite ist ein Bild ohne extrahierbaren Text. OCR fügt eine Textebene hinzu und erhält dabei die sichtbare Seitendarstellung. Beide Bilder sehen daher gleich aus; das herunterladbare Ergebnis enthält zusätzlich die erkannten Wörter.
Die Textextraktion aus der Quelle lieferte null Zeichen.

Das Ergebnis enthält alle sechs Beispielzeilen. Seine gerenderten Pixel stimmen bei der geprüften Bildgröße von 1.300 Pixeln mit der Quelle überein.

WORKSHOP-CHECKLISTE Bestätigen Sie die Raumbuchung. Drucken Sie vierzig Exemplare des Handouts. Testen Sie den Projektor vor 09:00 Uhr. Speichern Sie die endgültige Anwesenheitsliste. Dies ist ein harmloses OCR-Beispiel.
Verwendete Einstellungen: Seite 1; durchsuchbares PDF; Sprache Deutsch; Erkennung mit 200 DPI; einzelner Textblock; ursprüngliche Ausrichtung.
Dieses saubere deutsche Beispiel mit großer Schrift ist kein Genauigkeitsmaßstab für Kleingedrucktes, Handschrift, schiefe Scans oder andere Sprachen. Lesen Sie Namen, Beträge und Datumsangaben in Ihrem eigenen Ergebnis Korrektur.
Geprüft am . Harmlose Beispieldateien, die in der deutschen Oberfläche des Themes 3.8.0 mit einem lokalen Chromium-Browser verarbeitet wurden. Diese Beispiele sind kein Leistungsmaßstab für Live-Hosting.
| Einstellung | Was Sie erwarten können |
|---|---|
| Akzeptierte Eingabe | |
| Verarbeitungsort | Ihr Browser auf Ihrem Gerät |
| Dateiauswahl | Eine Eingabedatei |
| Eingabegröße | Bis zu 100 MB, abhängig von Gerätespeicher und Grenzen für dekodierte Seiten |
| Erkennungsstapel | Bis zu 20 ausgewählte Seiten; nur diese Seiten erscheinen im Download des durchsuchbaren PDFs. |
Das Werkzeug fügt eine Textebene hinzu; es rekonstruiert keine Tabellen als bearbeitbare Tabellenkalkulation und korrigiert keine sachlichen Inhalte. OCR ersetzt nicht die Prüfung von Namen, Kontonummern und anderem Text, bei dem Präzision entscheidend ist.
Die Drehungseinstellung dreht den gerenderten Scan, der an die Erkennung übergeben wird; das durchsuchbare PDF behält die sichtbare Darstellung der Quellseite. Sie ersetzt PDF drehen nicht, wenn Leser die Seite aufrecht sehen sollen. Wenn eine vorhandene Textebene Fehler enthält, kann erzwungene Erkennung eine weitere Ebene hinzufügen und doppelte Suchergebnisse erzeugen. Reine Text-OCR kann in dieser Situation eine nützliche geprüfte Extraktion sein. Vergleichen Sie leicht verwechselbare Zeichen wie 0/O, 1/l und Dezimaltrennzeichen mit dem Bild.
| Situation | Was Sie tun können |
|---|---|
| Ein Name oder eine Zahl ist falsch | Vergleichen Sie den erkannten Text mit dem Bild. Korrigieren Sie ihn vor der Wiederverwendung in einem geeigneten nachgelagerten Editor. |
| Eine vorhandene fehlerhafte OCR-Ebene hat sich nicht verbessert | Wählen Sie Jede ausgewählte Seite erkennen, um eine neue Ebene hinzuzufügen. Vorhandener Text bleibt erhalten, daher kann eine bestehende Ebene doppelte Suchergebnisse erzeugen; exportieren Sie reinen Text, wenn Sie eine saubere Extraktion benötigen. |
| Ein langes Paket wird abgewiesen | Teilen Sie es in Gruppen mit höchstens 20 Seiten, führen Sie für jede Gruppe OCR aus und prüfen Sie sie vor dem Zusammenführen. |
Suchen Sie bei einem maschinengeschriebenen Inspektionsblatt eine bekannte Gerätekennung im durchsuchbaren PDF und kopieren Sie diese Kennung sowie einen Messwert in einen Texteditor. Vergleichen Sie beide mit dem Scan und bestätigen Sie, dass die Auswahl die vorgesehene Zeile markiert. Eine erfolgreiche Wortsuche allein belegt weder eine korrekte Lesereihenfolge noch eine zuverlässige Zahlenextraktion.
Die Ausgabe bleibt ein PDF mit hinzugefügter Textebene. Verwenden Sie anschließend PDF in Word, wenn ein Textdokument mit neuem Umbruch benötigt wird.
Diese Version enthält Erkennungsmodelle für Englisch, Spanisch, Portugiesisch, Deutsch, Indonesisch, Russisch, Französisch, Italienisch, Türkisch, Arabisch, vereinfachtes Chinesisch, Japanisch, Koreanisch, Polnisch und Hindi. Deutsch ist die Standardeinstellung; wählen Sie die zur Quelle passende Sprache. OCR erkennt Zeichen, übersetzt das Dokument jedoch nicht. Andere Sprachen benötigen einen separat eingerichteten OCR-Ablauf.
Die Standardeinstellung behält Seiten mit vorhandener Textebene. Wählen Sie Jede ausgewählte Seite erkennen, um auch auf ihnen die Erkennung auszuführen.
Nein. Das durchsuchbare PDF enthält nur ausgewählte Seiten. Um ein langes Dokument zusammenzuhalten, erkennen Sie Stapel mit bis zu 20 Seiten und kombinieren Sie die geprüften Ausgaben in ihrer ursprünglichen Reihenfolge.
Nein. Sie dreht das der Erkennung übergebene Bild und erhält zugleich die sichtbare Darstellung der Quellseite im PDF. Verwenden Sie zuerst PDF drehen, wenn die gespeicherte Seite selbst aufrecht erscheinen soll.
Das Werkzeug erkennt Text in der ausgewählten Sprache. Es verspricht keine zuverlässige Handschrifterkennung und rekonstruiert keine Tabellenzellen. Verwenden Sie einen scharfen, aufrechten Scan von gedrucktem Text und prüfen Sie den Wortlaut, bevor Sie ihn in Word oder einer Tabellenkalkulation weiterverarbeiten.
Weiter mit PDF in Word, PDF in Text, Scan in PDF. Für Anforderungen an langfristige Speicherung siehe PDF in PDF/A; ein durchsuchbares PDF ist nicht automatisch PDF/A.