Wyodrębnianie istniejącego tekstu
Odczytaj warstwę tekstową dokumentu możliwą do zaznaczenia zamiast rozpoznawać litery na zeskanowanych obrazach.
Wyodrębnij istniejącą warstwę tekstową do pliku tekstowego UTF-8.
Przeciągnij pliki tutaj lub użyj przycisku poniżej.
Do 100 MB łącznie · Pliki pozostają na Twoim urządzeniu
Tutaj zobaczysz podgląd dokumentu. Dla dodawanej treści jest to wskazówka położenia; sprawdź zapisany wynik.
Wyodrębnij istniejącą warstwę tekstową PDF do wyszukiwania, kopiowania lub dalszej edycji. Wiersze są grupowane na podstawie ich położenia na stronie. Jest to szczególnie przydatne w raportach opartych głównie na tekście i archiwach dokumentów.
Wynik zawiera zwykły tekst bez czcionek, obrazów ani projektu strony. Kolejność czytania na stronach wielokolumnowych może różnić się od układu wizualnego. Ta operacja nie może przepisać zeskanowanej strony pozbawionej warstwy tekstowej.
Odczytaj warstwę tekstową dokumentu możliwą do zaznaczenia zamiast rozpoznawać litery na zeskanowanych obrazach.
Ogranicz eksport do rozdziału, listu lub załącznika za pomocą pola Strony.
Pobierz plik zwykłego tekstu, który otwiera się w popularnych edytorach tekstu bez układu programu do przetwarzania tekstów.
Pobliskie fragmenty tekstu są grupowane w wiersze. Kolejność czytania w wielu kolumnach nadal trzeba porównać ze stroną.
Zwykły tekst przydaje się, gdy słowa są ważniejsze od układu wydruku. Pozwala przeszukiwać lokalny folder, kopiować sformułowania do edytora lub przygotować uporządkowany punkt wyjścia do robienia notatek. Pozwala również uniknąć przenoszenia projektu strony z dużą ilością obrazów do zadania tekstowego. Warstwa tekstowa nie zawsze jest identyczna z tym, co strona wydaje się przekazywać: ligatury, ukryte błędy OCR i kolejność kolumn mogą zmienić eksport. Sprawdź reprezentatywne akapity oraz ważne nazwy i liczby przed użyciem wyniku do dalszej pracy.
Wyeksportuj tekst artykułu, z którego wolno Ci korzystać, aby zebrać cytaty i przygotować notatki z lektury. Porównaj każdy cytat ze stroną źródłową i zapisz numer strony oddzielnie.
Przenieś treść standardowego listu do edytora tekstu, aby przygotować poprawiony szkic. Sprawdź zwroty grzecznościowe, daty i podziały wierszy przed przeniesieniem jej do szablonu organizacji.
Odzyskaj sformułowania specyfikacji do przeszukiwalnej notatki roboczej. Porównaj jednostki, symbole i numerowane kroki z PDF, ponieważ nietypowe kodowania czcionek mogą zmienić wyodrębnione znaki.
Wybierz PDF z istniejącą warstwą tekstową możliwą do zaznaczenia.
Wybierz zrzut ekranu, aby go powiększyć.
Wybierz strony i opcjonalną nazwę pobieranego pliku.
Wybierz zrzut ekranu, aby go powiększyć.
Pobierz plik TXT i porównaj jego sformułowania z PDF.
Wybierz zrzut ekranu, aby go powiększyć.
Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.
| Ustawienie | Czego się spodziewać |
|---|---|
| Obsługiwany format wejściowy | |
| Miejsce przetwarzania | Twoja przeglądarka |
| Wybór plików | Jeden plik wejściowy |
| Rozmiar pliku wejściowego | Łącznie 100 MB; zdekodowane obrazy i strony podlegają również limitom liczby pikseli |
| Wybór stron | Do 200 wybranych stron na zadanie. Puste pole Strony oznacza wszystkie strony tylko wtedy, gdy PDF ma nie więcej niż 200 stron; w dłuższym dokumencie użyj oddzielnych zakresów. |
Jeśli nie można zaznaczyć żadnych słów, ponieważ strona jest skanem, dodaj i sprawdź warstwę tekstową OCR przed użyciem wyodrębniania tekstu.
Fragmenty tekstu mogą występować w PDF w innej kolejności niż ich widoczne położenia. Ramki boczne, przypisy dolne i układy dwukolumnowe są częstymi przyczynami przerwania zdania po eksporcie. Widoczna litera może również zależeć od mapowania czcionki, które nie przekazuje tego samego znaku do wyodrębniania. Porównaj akapit przechodzący przez granicę kolumny lub strony i sprawdź symbole techniczne oraz ligatury, takie jak „fi”, zanim potraktujesz TXT jako wiarygodną treść źródłową.
| Sytuacja | Co zrobić |
|---|---|
| Plik tekstowy jest pusty lub konwersja jest odrzucana | Wybrane strony mogą nie mieć warstwy tekstowej. Najpierw użyj OCR, jeśli jest dostępny. |
| Niektóre litery są niepoprawne | Kodowanie tekstu PDF lub warstwa OCR mogą być wadliwe. Porównaj nazwy, liczby i symbole z widoczną stroną. |
| Potrzebny jest edytowalny sformatowany dokument | Użyj narzędzia PDF na Word, aby uzyskać punkt wyjścia w DOCX; dokładny układ nadal wymaga sprawdzenia. |
Wyobraź sobie dwie kolumny zawierające A1, A2 po lewej i B1, B2 po prawej. Grupowanie według położenia może dać A1 B1, a następnie A2 B2, mieszając kolumny. Przeczytaj każdą kolumnę w PDF przed zmianą kolejności wyodrębnionych wierszy; poprawnie wyglądający plik tekstowy może mimo to łączyć niepowiązane zdania.
Najpierw uruchom OCR, aby dodać rozpoznany tekst. Wybranie źródła zawierającego tylko obrazy zwraca wyraźny komunikat o braku tekstu.
Grupowanie wierszy według położenia przybliża ich kolejność. Podziały akapitów i złożone kolumny wymagają przeglądu redakcyjnego.
Tekst z wybranych stron jest łączony z pustymi wierszami pomiędzy nimi. Zachowaj rzeczywisty zakres stron w notatkach, jeśli potrzebujesz dokładnych odwołań do PDF.
Skorzystaj również z narzędzi: OCR PDF, Czytnik PDF. Aby uzyskać wynik w innym języku, przeczytaj o procesie tłumaczenia PDF; samo wyodrębnianie tekstu nie tłumaczy.