Przeszukiwalny PDF lub TXT
Pobierz rozpoznane sformułowania jako zwykły tekst lub dodaj warstwę tekstową nad zachowanym wyglądem skanu w PDF.
Umożliw przeszukiwanie skanów, zachowując oryginalny wygląd strony.
Przeciągnij pliki tutaj lub użyj przycisku poniżej.
Do 100 MB łącznie · Pliki pozostają na Twoim urządzeniu
Tutaj zobaczysz podgląd dokumentu. Dla dodawanej treści jest to wskazówka położenia; sprawdź zapisany wynik.
Dodaj przeszukiwalną warstwę tekstową do zeskanowanego PDF za pomocą Tesseract działającego w przeglądarce. Wybierz język odpowiadający źródłu; domyślnie wybrany jest angielski. Obsługiwane czytniki mogą następnie wyszukiwać i zaznaczać rozpoznane słowa, a zeskanowana strona zachowuje oryginalny wygląd.
Domyślnie operacja zachowuje strony, które już zawierają tekst. Można również rozpoznać każdą wybraną stronę; dodaje to nową warstwę i może powielić istniejący tekst. Dokładność OCR zależy od ostrości, kontrastu, języka i wyrównania strony. Drobny druk, pismo odręczne, nietypowe kroje pisma i zaszumione skany wymagają starannego sprawdzenia zamiast automatycznego zaufania.
Pobierz rozpoznane sformułowania jako zwykły tekst lub dodaj warstwę tekstową nad zachowanym wyglądem skanu w PDF.
Pobrany plik zawiera tylko wybrane strony. Wybierz do 20 stron; pozostaw pole Strony puste, aby uwzględnić cały dokument tylko wtedy, gdy ma nie więcej niż 20 stron.
Wybierz język źródłowy, 200 lub 300 DPI, obrót do rozpoznawania oraz automatyczny układ strony, pojedynczy blok lub rozproszony tekst. Obsługiwane języki wymieniono w poniższych odpowiedziach na najczęściej zadawane pytania.
Strony już zawierające tekst można zachować. Wymuszaj rozpoznawanie dopiero po uwzględnieniu możliwości powielenia warstw tekstowych.
Skan przechowuje stronę jako obraz, więc zwykłe wyszukiwanie tekstu nie może znaleźć wydrukowanych na niej słów. OCR w wybranym języku może umożliwić przeszukiwanie skanu tekstu maszynowego i dostarczyć sformułowania do kopiowania i wklejania lub późniejszego wyodrębniania tekstu. Jest szczególnie przydatny w archiwach, gdzie odnalezienie znanej nazwy lub frazy jest ważniejsze niż przeprojektowanie strony. Rozpoznana warstwa może zawierać błędy, nawet gdy skan wygląda wyraźnie. Przetestuj wyszukiwanie i zaznaczanie, a następnie porównaj nazwy, odwołania i liczby z obrazem strony przed użyciem wyodrębnionych sformułowań.
Umożliw przeszukiwanie krótkiego dokumentu maszynowego według tytułu, nazwiska lub numeru referencyjnego. Zachowaj oryginalny skan i przetestuj te wyszukiwane hasła w pobranej kopii, w tym znaki, które łatwo pomylić.
Umożliw przeszukiwanie maszynowych notatek z kursu przed przygotowaniem notatek do nauki. Odręczne adnotacje mogą nadal być niewiarygodnie rozpoznawane, dlatego porównuj cytowane fragmenty ze skanem.
Wyodrębnij sformułowania z zatwierdzonej zeskanowanej notatki służbowej do wewnętrznego indeksu. Uważnie porównaj daty, nazwiska pracowników i numery referencyjne, ponieważ pojedynczy rozpoznany znak może zmienić identyfikator.
Wybierz skan w obsługiwanym języku i zaznacz do 20 stron.
Wybierz zrzut ekranu, aby go powiększyć.
Wybierz język źródłowy, wynik OCR, rozdzielczość, układ i orientację rozpoznawania.
Wybierz zrzut ekranu, aby go powiększyć.
Pobierz i porównaj rozpoznany tekst z oryginalnym skanem.
Wybierz zrzut ekranu, aby go powiększyć.
Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.
Strona źródłowa jest obrazem bez tekstu do wyodrębnienia. OCR dodaje warstwę tekstową, zachowując widoczny wygląd strony. Oba obrazy wyglądają więc tak samo; wynik do pobrania zawiera również rozpoznane słowa.
Wyodrębnianie tekstu ze źródła zwróciło zero znaków.

Wynik zawiera sześć wierszy. Pięć jest dokładnie zgodnych ze źródłem; w celowym szeregu wielkich polskich liter OCR pomija lub zmienia pięć znaków diakrytycznych. Wyrenderowane piksele odpowiadają źródłu przy testowanym rozmiarze 1300 pikseli.

LISTA KONTROLNA Sprawdź kolejność stron. Zachowaj źródło: Łódź. Zażółć gęślą jaźń. Polskie znaki: ACĘŁNOŚŹŹ. Kwota 125.50 EUR; godzina 09:00.
Użyte ustawienia: Strona 1; przeszukiwalny PDF; rozpoznawanie 200 DPI; pojedynczy blok tekstu; polski; oryginalna orientacja.
Ta wyraźna polska próbka zawiera celowo nietypowy szereg wielkich liter ĄĆĘŁŃÓŚŹŻ, rozpoznany jako ACĘŁNOŚŹŹ. Wynik pozostawiono bez poprawek. Przykład nie jest gwarancją dokładności; sprawdź nazwiska, kwoty, daty i znaki diakrytyczne we własnym dokumencie.
Sprawdzono . Oryginalne nieszkodliwe polskie próbki przetworzono lokalnie w Chromium z wersją 3.18.0. Przykłady dotyczą dostarczonych plików i nie są testem hostingu produkcyjnego.
| Ustawienie | Czego się spodziewać |
|---|---|
| Obsługiwany format wejściowy | |
| Miejsce przetwarzania | Twoja przeglądarka, na Twoim urządzeniu |
| Wybór plików | Jeden plik wejściowy |
| Rozmiar pliku wejściowego | Do 100 MB, z uwzględnieniem pamięci urządzenia i limitów zdekodowanych stron |
| Partia rozpoznawania | Do 20 wybranych stron; tylko te strony pojawiają się w pobranym przeszukiwalnym PDF. |
Narzędzie dodaje warstwę tekstową; nie odtwarza tabel jako edytowalnego arkusza kalkulacyjnego ani nie poprawia treści merytorycznej. OCR nie zastępuje sprawdzania nazwisk, numerów kont i innego tekstu wymagającego szczególnej precyzji.
Ustawienie obrotu obraca wyrenderowany skan przekazany do rozpoznawania; przeszukiwalny PDF zachowuje widoczny wygląd strony źródłowej. Nie zastępuje to narzędzia Obracanie PDF, gdy chcesz, aby czytelnicy widzieli stronę we właściwej orientacji. Jeśli istniejąca warstwa tekstowa zawiera błędy, wymuszenie rozpoznawania może dodać kolejną warstwę i powodować podwójne wyniki wyszukiwania. OCR do zwykłego tekstu może w takiej sytuacji stanowić przydatne wyodrębnienie po sprawdzeniu. Porównaj z obrazem łatwe do pomylenia znaki, takie jak 0/O, 1/l, i kropki dziesiętne.
| Sytuacja | Co zrobić |
|---|---|
| Nazwisko lub liczba są błędne | Porównaj rozpoznany tekst z obrazem. Popraw go w odpowiednim edytorze na dalszym etapie przed ponownym użyciem. |
| Istniejąca błędna warstwa OCR nie poprawiła się | Wybierz Rozpoznaj każdą wybraną stronę, aby dodać nową warstwę. Istniejący tekst jest zachowywany, więc dotychczasowa warstwa może powodować podwójne wyniki wyszukiwania; wyeksportuj zwykły tekst, jeśli potrzebujesz czystego wyodrębnienia. |
| Długi pakiet jest odrzucany | Podziel go na grupy po najwyżej 20 stron, wykonaj OCR każdej grupy i sprawdź wyniki przed połączeniem. |
W maszynowym arkuszu kontroli wyszukaj znany identyfikator urządzenia w przeszukiwalnym PDF, a następnie skopiuj ten identyfikator i jeden pomiar do edytora tekstu. Porównaj oba ze skanem i upewnij się, że zaznaczenie podświetla właściwy wiersz. Samo skuteczne wyszukanie słowa nie potwierdza poprawnej kolejności czytania ani wiarygodnego wyodrębniania liczb.
Wynik pozostaje PDF z dodaną warstwą tekstową. Następnie użyj narzędzia PDF na Word, jeśli potrzebny jest dokument z tekstem o zmiennym układzie.
To wydanie zawiera modele rozpoznawania języka angielskiego, hiszpańskiego, portugalskiego, niemieckiego, indonezyjskiego, rosyjskiego, francuskiego, włoskiego, tureckiego, arabskiego, chińskiego uproszczonego, japońskiego, koreańskiego, polskiego i hindi. Domyślny jest angielski; wybierz język odpowiadający źródłu. OCR rozpoznaje znaki, ale nie tłumaczy dokumentu. Inne języki wymagają oddzielnie skonfigurowanego procesu OCR.
Domyślne ustawienie zachowuje strony z istniejącą warstwą tekstową. Wybierz Rozpoznaj każdą wybraną stronę, aby wykonać rozpoznawanie również na nich.
Nie. Przeszukiwalny PDF zawiera tylko wybrane strony. Aby zachować długi dokument jako całość, rozpoznawaj partie po najwyżej 20 stron i łącz sprawdzone wyniki w oryginalnej kolejności.
Nie. Obraca obraz przekazany do rozpoznawania, zachowując widoczny wygląd strony źródłowej w PDF. Najpierw użyj narzędzia Obracanie PDF, gdy sama zapisana strona ma mieć właściwą orientację.
Narzędzie rozpoznaje tekst w wybranym języku; nie obiecuje wiarygodnego rozpoznawania pisma odręcznego ani odtwarzania komórek tabel. Użyj ostrego skanu tekstu maszynowego we właściwej orientacji i sprawdź sformułowania przed przeniesieniem ich do pracy w Wordzie lub arkuszu kalkulacyjnym.
Skorzystaj również z narzędzi: PDF na Word, PDF na tekst, Skan na PDF. Wymagania dotyczące długotrwałego przechowywania opisano w poradniku dotyczącym PDF do PDF/A; przeszukiwalny PDF nie jest automatycznie PDF/A.