PDF in YAML

Esporta elementi di testo PDF e relative posizioni di pagina come dati YAML.

Seleziona file PDF

Trascina i file qui oppure usa il pulsante qui sotto.

Fino a 25 MB totali · I file restano sul tuo dispositivo

Indice10 sezioni

Cosa può esportare PDF in YAML?

Crea un file YAML con elementi di testo estratti da pagine PDF selezionate. Il risultato include riferimenti alle pagine di origine, geometria delle pagine e trasformazioni della posizione del testo, per l’esame in un editor o in un flusso di elaborazione separato.

L’esportazione non interpreta il documento come configurazione di un’applicazione. Non deduce livelli dei titoli, estrae figure, riconosce campi di fattura o ricostruisce una tabella dal suo aspetto. Il testo segue l’ordine di estrazione del lettore PDF, che può differire dall’ordine di lettura.

Funzioni di PDF in YAML

Scalari testuali tra virgolette

Conserva parole come yes, date, punteggiatura e frasi con due punti come valori di stringa. Il testo estratto non diventa istruzioni YAML o tag di oggetti personalizzati.

Riferimenti alle pagine originali

Le pagine selezionate conservano i numeri di origine. I revisori possono tornare alla pagina PDF corrispondente senza contare le posizioni nell’array di uscita.

Geometria del testo

Memorizza trasformazioni e direzione del testo, oltre alle dimensioni delle pagine, insieme alle parole. Un processo successivo può esaminare la disposizione senza presumere che esista già una tabella pronta.

Ambito di estrazione esplicito

L’uscita dichiara che non sono stati effettuati ricostruzione semantica e OCR. Ciò aiuta un altro programma a trattare il risultato come dati estratti.

Come si converte il testo PDF in YAML?

  1. Scegli un PDF non crittografato con testo selezionabile.
  2. Inserisci un piccolo intervallo oppure lascia Pagine vuoto se il documento intero rientra nel limite di selezione.
  3. Avvia la conversione e salva il file .yaml.
  4. Apri il risultato in un editor compatibile con YAML e controlla le voci di pagine ed elementi.
  5. Confronta le stringhe importanti e le relative posizioni con il PDF originale prima di usarle in un altro flusso.

Seleziona il PDF

Scegli un PDF contenente il testo che vuoi esaminare.

Seleziona la schermata per ingrandirla.
PDF in YAML: selezione di un PDF di esempio.

Scegli l’intervallo di estrazione

Inizia con un piccolo gruppo di pagine di origine.

Seleziona la schermata per ingrandirla.
PDF in YAML: selezione delle pagine per l’esportazione strutturata.

Scarica il YAML

Salva il risultato ed esamina i valori testuali tra virgolette.

Seleziona la schermata per ingrandirla.
PDF in YAML: download dei dati strutturati completati.

Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.

Perché esportare il testo PDF come YAML?

YAML può essere comodo per revisioni testuali quando un gruppo desidera informazioni strutturate sulle pagine senza un visualizzatore separato. Usa l’esportazione come dati documentali e applica la tua validazione prima dell’importazione. Un prospetto PDF non deve diventare una configurazione attendibile soltanto perché le sue parole sono memorizzate in un file YAML.

Chi può usare un’estrazione YAML?

Sviluppatori di automazioni

Esamina testo e riferimenti di pagina prima di progettare regole di estrazione per un’impaginazione nota.

Gruppi di ricerca

Conserva un resoconto intermedio leggibile mentre controlli citazioni selezionate e le loro posizioni nelle pagine.

Revisori tecnici

Confronta le modifiche nei dati documentali estratti con strumenti che gestiscono file di testo strutturato.

Impostazioni e controlli del risultato

ImpostazioneCosa aspettarsi
File di ingressoUn PDF fino a 25 MiB e 500 pagine di origine.
Pagine selezionateFino a 200 pagine nell’ordine inserito; i riferimenti ripetuti compaiono una volta.
Limiti di estrazione20.000 elementi per pagina, 100.000 per elaborazione e due milioni di caratteri di testo.
Uscita YAMLYAML 1.2 dichiarato con valori di stringa tra virgolette; download massimo di 64 MiB.

Mantieni un valore stampato come testo

Un modulo può contenere la parola stampata yes accanto a un’etichetta e un numero con zeri iniziali. Esamina queste stringhe estratte nel YAML e confrontale con il sorgente. L’esportazione conserva il testo come valori tra virgolette, lasciando alla tua applicazione la decisione se un valore sia un’etichetta, un identificatore, una data o altro.

Risoluzione dei problemi di PDF in YAML

SituazioneCosa controllare
Il testo contiene sequenze UnicodeUn analizzatore YAML può recuperare i caratteri originali dalle sequenze tra virgolette. Questo impedisce inoltre ai caratteri di controllo di alterare la struttura del file.
Il risultato non è una configurazione pronta da importareÈ un resoconto di estrazione. Associa e valida separatamente i campi richiesti dalla tua applicazione.
La selezione è troppo densaRiduci l’intervallo di pagine. Una pagina densa può raggiungere il limite degli elementi di testo o dei caratteri prima di quello delle pagine.

Domande frequenti

Questo strumento legge o esegue YAML in ingresso?

No. Legge un PDF e crea un risultato YAML. Non carica YAML inviato, non esegue tag e non applica impostazioni di configurazione.

Riconosce il testo nelle pagine scansionate?

Non viene effettuato OCR automatico. Esegui prima OCR su un PDF composto da immagini, quindi esamina il testo riconosciuto prima di esportarlo.

Gli elementi estratti sono già nell’ordine di lettura?

Non necessariamente. Le pagine a più colonne e le etichette posizionate possono produrre un ordine di estrazione diverso. Controlla le coordinate e la pagina originale.

Strumenti correlati

PDF in JSON, PDF in XML, OCR PDF.