PDF na tekst

Wyodrębnij istniejącą warstwę tekstową do pliku tekstowego UTF-8.

Wybierz pliki PDF

Przeciągnij pliki tutaj lub użyj przycisku poniżej.

Do 100 MB łącznie · Pliki pozostają na Twoim urządzeniu

Spis treściSekcje: 11

Co można wyodrębnić z PDF jako zwykły tekst?

Wyodrębnij istniejącą warstwę tekstową PDF do wyszukiwania, kopiowania lub dalszej edycji. Wiersze są grupowane na podstawie ich położenia na stronie. Jest to szczególnie przydatne w raportach opartych głównie na tekście i archiwach dokumentów.

Wynik zawiera zwykły tekst bez czcionek, obrazów ani projektu strony. Kolejność czytania na stronach wielokolumnowych może różnić się od układu wizualnego. Ta operacja nie może przepisać zeskanowanej strony pozbawionej warstwy tekstowej.

Funkcje narzędzia PDF na tekst

Wyodrębnianie istniejącego tekstu

Odczytaj warstwę tekstową dokumentu możliwą do zaznaczenia zamiast rozpoznawać litery na zeskanowanych obrazach.

Wybór odpowiednich stron

Ogranicz eksport do rozdziału, listu lub załącznika za pomocą pola Strony.

Przenośny wynik TXT

Pobierz plik zwykłego tekstu, który otwiera się w popularnych edytorach tekstu bez układu programu do przetwarzania tekstów.

Grupowanie wierszy według położenia

Pobliskie fragmenty tekstu są grupowane w wiersze. Kolejność czytania w wielu kolumnach nadal trzeba porównać ze stroną.

Po co konwertować treść PDF na plik tekstowy?

Zwykły tekst przydaje się, gdy słowa są ważniejsze od układu wydruku. Pozwala przeszukiwać lokalny folder, kopiować sformułowania do edytora lub przygotować uporządkowany punkt wyjścia do robienia notatek. Pozwala również uniknąć przenoszenia projektu strony z dużą ilością obrazów do zadania tekstowego. Warstwa tekstowa nie zawsze jest identyczna z tym, co strona wydaje się przekazywać: ligatury, ukryte błędy OCR i kolejność kolumn mogą zmienić eksport. Sprawdź reprezentatywne akapity oraz ważne nazwy i liczby przed użyciem wyniku do dalszej pracy.

Kto korzysta z tekstu wyodrębnionego z PDF?

Badacze uniwersyteccy

Wyeksportuj tekst artykułu, z którego wolno Ci korzystać, aby zebrać cytaty i przygotować notatki z lektury. Porównaj każdy cytat ze stroną źródłową i zapisz numer strony oddzielnie.

Pracownicy administracyjni

Przenieś treść standardowego listu do edytora tekstu, aby przygotować poprawiony szkic. Sprawdź zwroty grzecznościowe, daty i podziały wierszy przed przeniesieniem jej do szablonu organizacji.

Autorzy dokumentacji technicznej

Odzyskaj sformułowania specyfikacji do przeszukiwalnej notatki roboczej. Porównaj jednostki, symbole i numerowane kroki z PDF, ponieważ nietypowe kodowania czcionek mogą zmienić wyodrębnione znaki.

Jak wyodrębnić tekst z PDF?

  1. Wybierz PDF z tekstem możliwym do zaznaczenia. Jeśli jest to skan zawierający wyłącznie obrazy, najpierw utwórz warstwę tekstową za pomocą OCR.
  2. Wpisz strony do wyodrębnienia lub pozostaw pole Strony puste, aby wybrać cały dokument. Dodaj nazwę pobieranego pliku, jeśli to przydatne.
  3. Uruchom wyodrębnianie i pobierz plik TXT. Otwórz go w edytorze tekstu.
  4. Porównaj kolejność akapitów, interpunkcję, nazwy i ważne liczby z oryginalnym PDF przed edycją lub cytowaniem tekstu.

Wybierz plik źródłowy

Wybierz PDF z istniejącą warstwą tekstową możliwą do zaznaczenia.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na tekst, krok 1: Wybierz PDF z istniejącą warstwą tekstową możliwą do zaznaczenia.

Sprawdź ustawienia narzędzia

Wybierz strony i opcjonalną nazwę pobieranego pliku.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na tekst, krok 2: Wybierz strony i opcjonalną nazwę pobieranego pliku.

Pobierz i sprawdź wynik

Pobierz plik TXT i porównaj jego sformułowania z PDF.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na tekst, krok 3: Pobierz plik TXT i porównaj jego sformułowania z PDF.

Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.

Ustawienia i kontrola wyniku

UstawienieCzego się spodziewać
Obsługiwany format wejściowyPDF
Miejsce przetwarzaniaTwoja przeglądarka
Wybór plikówJeden plik wejściowy
Rozmiar pliku wejściowegoŁącznie 100 MB; zdekodowane obrazy i strony podlegają również limitom liczby pikseli
Wybór stronDo 200 wybranych stron na zadanie. Puste pole Strony oznacza wszystkie strony tylko wtedy, gdy PDF ma nie więcej niż 200 stron; w dłuższym dokumencie użyj oddzielnych zakresów.

Jeśli nie można zaznaczyć żadnych słów, ponieważ strona jest skanem, dodaj i sprawdź warstwę tekstową OCR przed użyciem wyodrębniania tekstu.

Sprawdź kolejność czytania i zakodowane znaki

Fragmenty tekstu mogą występować w PDF w innej kolejności niż ich widoczne położenia. Ramki boczne, przypisy dolne i układy dwukolumnowe są częstymi przyczynami przerwania zdania po eksporcie. Widoczna litera może również zależeć od mapowania czcionki, które nie przekazuje tego samego znaku do wyodrębniania. Porównaj akapit przechodzący przez granicę kolumny lub strony i sprawdź symbole techniczne oraz ligatury, takie jak „fi”, zanim potraktujesz TXT jako wiarygodną treść źródłową.

Rozwiązywanie problemów z konwersją PDF na tekst

SytuacjaCo zrobić
Plik tekstowy jest pusty lub konwersja jest odrzucanaWybrane strony mogą nie mieć warstwy tekstowej. Najpierw użyj OCR, jeśli jest dostępny.
Niektóre litery są niepoprawneKodowanie tekstu PDF lub warstwa OCR mogą być wadliwe. Porównaj nazwy, liczby i symbole z widoczną stroną.
Potrzebny jest edytowalny sformatowany dokumentUżyj narzędzia PDF na Word, aby uzyskać punkt wyjścia w DOCX; dokładny układ nadal wymaga sprawdzenia.

Praktyczny przykład i końcowa kontrola

Wyobraź sobie dwie kolumny zawierające A1, A2 po lewej i B1, B2 po prawej. Grupowanie według położenia może dać A1 B1, a następnie A2 B2, mieszając kolumny. Przeczytaj każdą kolumnę w PDF przed zmianą kolejności wyodrębnionych wierszy; poprawnie wyglądający plik tekstowy może mimo to łączyć niepowiązane zdania.

Najczęściej zadawane pytania

Czy można wyodrębnić tekst z zeskanowanego PDF?

Najpierw uruchom OCR, aby dodać rozpoznany tekst. Wybranie źródła zawierającego tylko obrazy zwraca wyraźny komunikat o braku tekstu.

Czy narzędzie zachowuje akapity?

Grupowanie wierszy według położenia przybliża ich kolejność. Podziały akapitów i złożone kolumny wymagają przeglądu redakcyjnego.

Jak strony są oddzielane w pobieranym tekście?

Tekst z wybranych stron jest łączony z pustymi wierszami pomiędzy nimi. Zachowaj rzeczywisty zakres stron w notatkach, jeśli potrzebujesz dokładnych odwołań do PDF.

Powiązane narzędzia i poradniki

Skorzystaj również z narzędzi: OCR PDF, Czytnik PDF. Aby uzyskać wynik w innym języku, przeczytaj o procesie tłumaczenia PDF; samo wyodrębnianie tekstu nie tłumaczy.