PDF na YAML

Eksportuj elementy tekstowe PDF i ich położenie na stronach jako dane YAML.

Wybierz pliki PDF

Przeciągnij pliki tutaj lub użyj przycisku poniżej.

Do 25 MB łącznie · Pliki pozostają na Twoim urządzeniu

Spis treściSekcje: 10

Co może wyeksportować konwersja PDF na YAML?

Utwórz plik YAML zawierający elementy tekstowe wyodrębnione z wybranych stron PDF. Wynik obejmuje odwołania do stron źródłowych, geometrię stron i przekształcenia położenia tekstu. Nadaje się do analizy w edytorze tekstu lub do osobnego procesu przetwarzania.

Eksport nie interpretuje dokumentu jako konfiguracji aplikacji. Nie ustala poziomów nagłówków, nie wyodrębnia obrazów, nie rozpoznaje pól faktury ani nie odbudowuje tabeli na podstawie wyglądu. Tekst zachowuje kolejność ekstrakcji czytnika PDF, która może różnić się od kolejności czytania.

Funkcje konwersji PDF na YAML

Wartości tekstowe w cudzysłowach

Zachowaj słowa takie jak yes, daty, interpunkcję i frazy z dwukropkami jako ciągi znaków. Wyodrębniony tekst nie staje się instrukcjami YAML ani niestandardowymi znacznikami obiektów.

Odwołania do oryginalnych stron

Wybrane strony zachowują numery źródłowe. Osoby sprawdzające mogą wrócić do odpowiedniej strony PDF bez liczenia pozycji w tablicy wynikowej.

Geometria tekstu

Zapisz przekształcenia tekstu, kierunek i wymiary stron wraz ze słowami. Dalszy proces może analizować położenie, zamiast zakładać istnienie gotowej tabeli.

Jawny zakres ekstrakcji

Wynik deklaruje, że nie przeprowadzono rekonstrukcji semantycznej ani OCR. Pomaga to innemu programowi traktować rezultat jako wyodrębniony materiał źródłowy.

Jak przekonwertować tekst PDF na YAML?

  1. Wybierz jeden niezaszyfrowany PDF z zaznaczalnym tekstem.
  2. Wpisz mały zakres stron albo pozostaw pole Strony puste, jeśli cały dokument mieści się w limicie wyboru.
  3. Rozpocznij konwersję i zapisz plik .yaml.
  4. Otwórz wynik w edytorze obsługującym YAML i sprawdź wpisy stron oraz elementów.
  5. Porównaj ważne ciągi znaków i ich położenie z oryginalnym PDF przed użyciem w innym procesie.

Wybierz PDF

Wybierz PDF zawierający tekst, który chcesz sprawdzić.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na YAML: wybór przykładowego PDF.

Wybierz zakres ekstrakcji

Zacznij od niewielkiego zestawu stron źródłowych.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na YAML: wybór stron do eksportu uporządkowanych danych.

Pobierz YAML

Zapisz wynik i sprawdź wartości tekstowe w cudzysłowach.

Wybierz zrzut ekranu, aby go powiększyć.
PDF na YAML: pobieranie gotowych uporządkowanych danych.

Zrzuty ekranu przedstawiają te narzędzia z nieszkodliwymi plikami przykładowymi. Nazwa Twojego pliku, liczba stron i ustawienia mogą się różnić.

Dlaczego warto eksportować tekst PDF do YAML?

YAML bywa wygodny przy przeglądzie tekstu, gdy zespół potrzebuje uporządkowanych informacji o stronach bez osobnej przeglądarki. Traktuj eksport jako dane dokumentu i zastosuj własną weryfikację przed importem. Zestawienie PDF nie powinno stawać się zaufaną konfiguracją tylko dlatego, że jego słowa zapisano w pliku YAML.

Kto może korzystać z ekstrakcji YAML?

Programiści automatyzacji

Sprawdź tekst i odwołania do stron przed zaprojektowaniem reguł ekstrakcji dla znanego układu dokumentu.

Zespoły badawcze

Zachowaj czytelny zapis pośredni podczas sprawdzania wybranych cytatów i ich położenia na stronach.

Osoby prowadzące przeglądy techniczne

Porównuj zmiany w wyodrębnionych danych dokumentu narzędziami obsługującymi uporządkowane pliki tekstowe.

Ustawienia i kontrola wyników

UstawienieOczekiwany rezultat
Plik wejściowyJeden PDF do 25 MiB i 500 stron źródłowych.
Wybrane stronyDo 200 stron w podanej kolejności; powtórzone odwołania do stron występują tylko raz.
Granice ekstrakcji20 000 elementów na stronę, 100 000 na zadanie i dwa miliony znaków tekstu.
Wynik YAMLZadeklarowany YAML 1.2 z ciągami znaków w cudzysłowach; maksymalny rozmiar pobierania 64 MiB.

Zachowaj wydrukowaną wartość jako tekst

Formularz może zawierać wydrukowane słowo yes obok etykiety oraz liczbę z zerami na początku. Sprawdź te wyodrębnione ciągi w YAML i porównaj ze źródłem. Eksport zachowuje tekst jako wartości w cudzysłowach, dzięki czemu Twoja aplikacja może ustalić, czy wartość jest etykietą, identyfikatorem, datą czy czymś innym.

Rozwiązywanie problemów z konwersją PDF na YAML

SytuacjaCo sprawdzić
Tekst zawiera sekwencje ucieczki UnicodeParser YAML może odzyskać oryginalne znaki z sekwencji w cudzysłowach. Zapobiega to również zaburzeniu struktury pliku przez znaki sterujące.
Wynik nie jest konfiguracją gotową do importuTo zapis ekstrakcji. Osobno zmapuj i zweryfikuj pola wymagane przez Twoją aplikację.
Wybrana zawartość jest zbyt gęstaZmniejsz zakres stron. Gęsta strona może osiągnąć limit elementów tekstowych lub znaków przed limitem stron.

Najczęstsze pytania

Czy to narzędzie odczytuje lub wykonuje wejściowy YAML?

Nie. Odczytuje PDF i tworzy wynik YAML. Nie wczytuje przesłanego YAML, nie wykonuje znaczników ani nie stosuje ustawień konfiguracji.

Czy rozpoznaje tekst na zeskanowanych stronach?

Automatyczne OCR nie jest wykonywane. Najpierw wykonaj OCR pliku PDF zawierającego wyłącznie obrazy, a następnie sprawdź rozpoznany tekst przed eksportem.

Czy wyodrębnione elementy są już w kolejności czytania?

Niekoniecznie. Strony wielokolumnowe i pozycjonowane etykiety mogą dawać inną kolejność ekstrakcji. Sprawdź ich współrzędne i oryginalną stronę.

Powiązane narzędzia

PDF na JSON, PDF na XML, Rozpoznawanie tekstu w PDF.