OCR PDF

Umożliw przeszukiwanie skanów, zachowując oryginalny wygląd strony.

Wybierz pliki PDF

Przeciągnij pliki tutaj lub użyj przycisku poniżej.

Do 100 MB łącznie · Pliki pozostają na Twoim urządzeniu

Spis treściSekcje: 12

Kiedy PDF wymaga OCR?

Dodaj przeszukiwalną warstwę tekstową do zeskanowanego PDF za pomocą Tesseract działającego w przeglądarce. Wybierz język odpowiadający źródłu; domyślnie wybrany jest angielski. Obsługiwane czytniki mogą następnie wyszukiwać i zaznaczać rozpoznane słowa, a zeskanowana strona zachowuje oryginalny wygląd.

Domyślnie operacja zachowuje strony, które już zawierają tekst. Można również rozpoznać każdą wybraną stronę; dodaje to nową warstwę i może powielić istniejący tekst. Dokładność OCR zależy od ostrości, kontrastu, języka i wyrównania strony. Drobny druk, pismo odręczne, nietypowe kroje pisma i zaszumione skany wymagają starannego sprawdzenia zamiast automatycznego zaufania.

Funkcje narzędzia OCR PDF

Przeszukiwalny PDF lub TXT

Pobierz rozpoznane sformułowania jako zwykły tekst lub dodaj warstwę tekstową nad zachowanym wyglądem skanu w PDF.

Do 20 wybranych stron

Pobrany plik zawiera tylko wybrane strony. Wybierz do 20 stron; pozostaw pole Strony puste, aby uwzględnić cały dokument tylko wtedy, gdy ma nie więcej niż 20 stron.

Ustawienia rozpoznawania

Wybierz język źródłowy, 200 lub 300 DPI, obrót do rozpoznawania oraz automatyczny układ strony, pojedynczy blok lub rozproszony tekst. Obsługiwane języki wymieniono w poniższych odpowiedziach na najczęściej zadawane pytania.

Domyślne zachowanie istniejącego tekstu

Strony już zawierające tekst można zachować. Wymuszaj rozpoznawanie dopiero po uwzględnieniu możliwości powielenia warstw tekstowych.

Po co dodawać przeszukiwalną warstwę tekstową do skanu?

Skan przechowuje stronę jako obraz, więc zwykłe wyszukiwanie tekstu nie może znaleźć wydrukowanych na niej słów. OCR w wybranym języku może umożliwić przeszukiwanie skanu tekstu maszynowego i dostarczyć sformułowania do kopiowania i wklejania lub późniejszego wyodrębniania tekstu. Jest szczególnie przydatny w archiwach, gdzie odnalezienie znanej nazwy lub frazy jest ważniejsze niż przeprojektowanie strony. Rozpoznana warstwa może zawierać błędy, nawet gdy skan wygląda wyraźnie. Przetestuj wyszukiwanie i zaznaczanie, a następnie porównaj nazwy, odwołania i liczby z obrazem strony przed użyciem wyodrębnionych sformułowań.

Kto korzysta z OCR skanów PDF?

Pracownicy bibliotek i archiwów

Umożliw przeszukiwanie krótkiego dokumentu maszynowego według tytułu, nazwiska lub numeru referencyjnego. Zachowaj oryginalny skan i przetestuj te wyszukiwane hasła w pobranej kopii, w tym znaki, które łatwo pomylić.

Studenci korzystający ze zeskanowanych materiałów

Umożliw przeszukiwanie maszynowych notatek z kursu przed przygotowaniem notatek do nauki. Odręczne adnotacje mogą nadal być niewiarygodnie rozpoznawane, dlatego porównuj cytowane fragmenty ze skanem.

Pracownicy bieżącej administracji kadrowej

Wyodrębnij sformułowania z zatwierdzonej zeskanowanej notatki służbowej do wewnętrznego indeksu. Uważnie porównaj daty, nazwiska pracowników i numery referencyjne, ponieważ pojedynczy rozpoznany znak może zmienić identyfikator.

Jak umożliwić przeszukiwanie zeskanowanego PDF?

  1. Wybierz niezaszyfrowany skan i nie więcej niż 20 stron. Pobrany PDF zawiera tylko ten wybór. Zacznij od krótkiej próbki, jeśli wcześniej nie korzystano z tego rodzaju skanu.
  2. Wybierz język źródłowy w polu Język tekstu. Wybierz Przeszukiwalny PDF lub Zwykły tekst, ustaw rozdzielczość rozpoznawania i wybierz obrót lub układ strony, jeśli skan tego wymaga.
  3. Domyślnie zachowaj istniejący tekst lub świadomie wybierz Rozpoznaj każdą wybraną stronę. Uruchom OCR i poczekaj na zakończenie rozpoznawania.
  4. Pobierz wynik. Wyszukaj znaną frazę, skopiuj wiersz i porównaj pisownię oraz liczby z oryginalnym skanem.

Wybierz plik źródłowy

Wybierz skan w obsługiwanym języku i zaznacz do 20 stron.

Wybierz zrzut ekranu, aby go powiększyć.
OCR PDF, krok 1: Wybierz skan w obsługiwanym języku i zaznacz do 20 stron.

Sprawdź ustawienia narzędzia

Wybierz język źródłowy, wynik OCR, rozdzielczość, układ i orientację rozpoznawania.

Wybierz zrzut ekranu, aby go powiększyć.
OCR PDF, krok 2: Wybierz język źródłowy, wynik OCR, rozdzielczość, układ i orientację rozpoznawania.

Pobierz i sprawdź wynik

Pobierz i porównaj rozpoznany tekst z oryginalnym skanem.

Wybierz zrzut ekranu, aby go powiększyć.
OCR PDF, krok 3: Pobierz i porównaj rozpoznany tekst z oryginalnym skanem.

Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.

Lista kontrolna w formie obrazu z możliwością wyszukiwania

Strona źródłowa jest obrazem bez tekstu do wyodrębnienia. OCR dodaje warstwę tekstową, zachowując widoczny wygląd strony. Oba obrazy wyglądają więc tak samo; wynik do pobrania zawiera również rozpoznane słowa.

Przed: strona zawierająca wyłącznie obraz

Wyodrębnianie tekstu ze źródła zwróciło zero znaków.

Rzeczywista obrazowa lista kontrolna przed OCR bez warstwy tekstu, który można zaznaczyć.

Po: ta sama strona, przeszukiwalny tekst

Wynik zawiera sześć wierszy. Pięć jest dokładnie zgodnych ze źródłem; w celowym szeregu wielkich polskich liter OCR pomija lub zmienia pięć znaków diakrytycznych. Wyrenderowane piksele odpowiadają źródłu przy testowanym rozmiarze 1300 pikseli.

Rzeczywisty przeszukiwalny PDF wynikowy z taką samą widoczną listą kontrolną i nową warstwą tekstową.
Tekst źródłowy
0 znaków
Tekst wynikowy
141 znaków
Kontrola rozpoznawania
5 z 6 wierszy dokładnie zgodnych
Przeczytaj tekst wyodrębniony z tego wyniku
LISTA KONTROLNA
Sprawdź kolejność stron.
Zachowaj źródło: Łódź.
Zażółć gęślą jaźń.
Polskie znaki: ACĘŁNOŚŹŹ.
Kwota 125.50 EUR; godzina 09:00.

Użyte ustawienia: Strona 1; przeszukiwalny PDF; rozpoznawanie 200 DPI; pojedynczy blok tekstu; polski; oryginalna orientacja.

Ta wyraźna polska próbka zawiera celowo nietypowy szereg wielkich liter ĄĆĘŁŃÓŚŹŻ, rozpoznany jako ACĘŁNOŚŹŹ. Wynik pozostawiono bez poprawek. Przykład nie jest gwarancją dokładności; sprawdź nazwiska, kwoty, daty i znaki diakrytyczne we własnym dokumencie.

Sprawdzono . Oryginalne nieszkodliwe polskie próbki przetworzono lokalnie w Chromium z wersją 3.18.0. Przykłady dotyczą dostarczonych plików i nie są testem hostingu produkcyjnego.

Ustawienia i kontrola wyniku

UstawienieCzego się spodziewać
Obsługiwany format wejściowyPDF
Miejsce przetwarzaniaTwoja przeglądarka, na Twoim urządzeniu
Wybór plikówJeden plik wejściowy
Rozmiar pliku wejściowegoDo 100 MB, z uwzględnieniem pamięci urządzenia i limitów zdekodowanych stron
Partia rozpoznawaniaDo 20 wybranych stron; tylko te strony pojawiają się w pobranym przeszukiwalnym PDF.

Narzędzie dodaje warstwę tekstową; nie odtwarza tabel jako edytowalnego arkusza kalkulacyjnego ani nie poprawia treści merytorycznej. OCR nie zastępuje sprawdzania nazwisk, numerów kont i innego tekstu wymagającego szczególnej precyzji.

Sprawdź orientację rozpoznawania bez zmiany skanu

Ustawienie obrotu obraca wyrenderowany skan przekazany do rozpoznawania; przeszukiwalny PDF zachowuje widoczny wygląd strony źródłowej. Nie zastępuje to narzędzia Obracanie PDF, gdy chcesz, aby czytelnicy widzieli stronę we właściwej orientacji. Jeśli istniejąca warstwa tekstowa zawiera błędy, wymuszenie rozpoznawania może dodać kolejną warstwę i powodować podwójne wyniki wyszukiwania. OCR do zwykłego tekstu może w takiej sytuacji stanowić przydatne wyodrębnienie po sprawdzeniu. Porównaj z obrazem łatwe do pomylenia znaki, takie jak 0/O, 1/l, i kropki dziesiętne.

Rozwiązywanie problemów z OCR PDF

SytuacjaCo zrobić
Nazwisko lub liczba są błędnePorównaj rozpoznany tekst z obrazem. Popraw go w odpowiednim edytorze na dalszym etapie przed ponownym użyciem.
Istniejąca błędna warstwa OCR nie poprawiła sięWybierz Rozpoznaj każdą wybraną stronę, aby dodać nową warstwę. Istniejący tekst jest zachowywany, więc dotychczasowa warstwa może powodować podwójne wyniki wyszukiwania; wyeksportuj zwykły tekst, jeśli potrzebujesz czystego wyodrębnienia.
Długi pakiet jest odrzucanyPodziel go na grupy po najwyżej 20 stron, wykonaj OCR każdej grupy i sprawdź wyniki przed połączeniem.

Praktyczny przykład i końcowa kontrola

W maszynowym arkuszu kontroli wyszukaj znany identyfikator urządzenia w przeszukiwalnym PDF, a następnie skopiuj ten identyfikator i jeden pomiar do edytora tekstu. Porównaj oba ze skanem i upewnij się, że zaznaczenie podświetla właściwy wiersz. Samo skuteczne wyszukanie słowa nie potwierdza poprawnej kolejności czytania ani wiarygodnego wyodrębniania liczb.

Najczęściej zadawane pytania

Czy OCR zamienia stronę w edytowalną treść Worda?

Wynik pozostaje PDF z dodaną warstwą tekstową. Następnie użyj narzędzia PDF na Word, jeśli potrzebny jest dokument z tekstem o zmiennym układzie.

Jakie języki są dostępne?

To wydanie zawiera modele rozpoznawania języka angielskiego, hiszpańskiego, portugalskiego, niemieckiego, indonezyjskiego, rosyjskiego, francuskiego, włoskiego, tureckiego, arabskiego, chińskiego uproszczonego, japońskiego, koreańskiego, polskiego i hindi. Domyślny jest angielski; wybierz język odpowiadający źródłu. OCR rozpoznaje znaki, ale nie tłumaczy dokumentu. Inne języki wymagają oddzielnie skonfigurowanego procesu OCR.

Dlaczego strona została pominięta?

Domyślne ustawienie zachowuje strony z istniejącą warstwą tekstową. Wybierz Rozpoznaj każdą wybraną stronę, aby wykonać rozpoznawanie również na nich.

Czy wynik obejmuje strony, których nie wybrano?

Nie. Przeszukiwalny PDF zawiera tylko wybrane strony. Aby zachować długi dokument jako całość, rozpoznawaj partie po najwyżej 20 stron i łącz sprawdzone wyniki w oryginalnej kolejności.

Czy obrót do rozpoznawania obróci widoczną stronę PDF?

Nie. Obraca obraz przekazany do rozpoznawania, zachowując widoczny wygląd strony źródłowej w PDF. Najpierw użyj narzędzia Obracanie PDF, gdy sama zapisana strona ma mieć właściwą orientację.

Czy to narzędzie wiarygodnie odczytuje pismo odręczne lub odtwarza tabele?

Narzędzie rozpoznaje tekst w wybranym języku; nie obiecuje wiarygodnego rozpoznawania pisma odręcznego ani odtwarzania komórek tabel. Użyj ostrego skanu tekstu maszynowego we właściwej orientacji i sprawdź sformułowania przed przeniesieniem ich do pracy w Wordzie lub arkuszu kalkulacyjnym.

Powiązane narzędzia i poradniki

Skorzystaj również z narzędzi: PDF na Word, PDF na tekst, Skan na PDF. Wymagania dotyczące długotrwałego przechowywania opisano w poradniku dotyczącym PDF do PDF/A; przeszukiwalny PDF nie jest automatycznie PDF/A.