PDF in XML

Estrai elementi di testo PDF e geometria delle pagine in una struttura XML documentata.

Seleziona file PDF

Trascina i file qui oppure usa il pulsante qui sotto.

Fino a 25 MB totali · I file restano sul tuo dispositivo

Indice10 sezioni

Cosa contiene l’esportazione XML?

Esporta il livello di testo selezionabile di un PDF in XML. Il file raggruppa gli elementi di testo sotto i numeri di pagina originali e registra geometria della pagina, direzione del testo e trasformazioni di posizione. Fornisce dati strutturati da esaminare ed elaborare successivamente.

L’XML descrive ciò che il lettore del testo PDF ha estratto. Non è l’XML originale che potrebbe aver generato il documento e non identifica campi di fattura, non ricostruisce relazioni tra tabelle e non esporta immagini. Le pagine composte solo da immagini richiedono prima OCR.

Funzioni di PDF in XML

Elementi organizzati per pagina

Conserva numeri delle pagine di origine, rotazione e limiti dell’area visibile insieme al testo estratto. Questo mantiene un riferimento utile durante l’esame di un intervallo selezionato.

Valori testuali con escape

Caratteri come la e commerciale e le parentesi angolari restano dati all’interno degli elementi XML. Il testo che sembra marcatura non può diventare contenuto eseguibile della pagina attraverso questa esportazione.

Stringhe speciali reversibili

I caratteri che XML non può rappresentare direttamente utilizzano una codifica di stringa JSON segnalata in modo esplicito. Il marcatore consente al programma ricevente di recuperare i valori con precisione.

Elaborazione nel browser

Crea il file XML sul tuo dispositivo. Il sorgente non viene caricato per la conversione né riscritto.

Come si estrae XML da un PDF?

  1. Seleziona un PDF non crittografato contenente testo selezionabile.
  2. Inserisci i numeri o gli intervalli richiesti in Pagine.
  3. Converti il file e scarica il risultato XML.
  4. Apri l’XML in un editor di testo o in un’applicazione compatibile con XML.
  5. Confronta una pagina e una frase conosciute prima di associare gli elementi a un altro sistema.

Scegli il PDF sorgente

Seleziona un PDF con un livello di testo leggibile.

Seleziona la schermata per ingrandirla.
PDF in XML: selezione di un PDF sorgente.

Limita l’intervallo di pagine

Scegli le pagine necessarie all’estrazione XML.

Seleziona la schermata per ingrandirla.
PDF in XML: intervallo di pagine e limiti di estrazione.

Salva l’XML

Scarica l’XML ed esamina i suoi elementi di pagina.

Seleziona la schermata per ingrandirla.
PDF in XML: download dell’esportazione XML completata.

Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.

Perché usare XML per analizzare il testo PDF?

Un flusso basato su XML può richiedere elementi espliciti di pagina e testo prima di applicare le proprie regole di trasformazione. Un gruppo può esaminare tali elementi, conservare i riferimenti alle pagine di origine e creare una mappatura separata per tipi di documento noti. Mantieni la mappatura distinta dall’estrazione: la vicinanza tra due elementi di testo non stabilisce da sola una relazione aziendale.

Chi può lavorare con questa uscita XML?

Sviluppatori di integrazioni

Usa gli elementi di pagina e testo come ingresso per un flusso controllato di elaborazione documentale.

Archivisti documentali

Verifica se il testo resta disponibile accanto al PDF originale conservato.

Revisori dei dati

Confronta valori campione con le pagine di origine prima di accettare regole di trasformazione.

Impostazioni e controlli del risultato

ImpostazioneCosa aspettarsi
OrigineUn PDF fino a 25 MiB, con al massimo 500 pagine di origine.
Intervallo di pagineFino a 200 pagine selezionate. Un intervallo vuoto include tutte le pagine solo se rispetta questo limite.
Limiti del testoFino a 20.000 elementi per pagina, 100.000 per elaborazione e due milioni di caratteri di testo.
File da scaricareUn documento XML fino a 64 MiB. Non vengono richiesti DTD o schemi esterni.

Associa un’etichetta nota dopo aver controllato la pagina

Per un documento di consegna, esporta una pagina e trova un numero di riferimento noto. Confronta la sua trasformazione del testo e gli elementi vicini con la pagina originale. La tua applicazione potrà quindi applicare una regola per quel tipo di documento. Evita di trattare tutti i numeri vicini come lo stesso campo in impaginazioni non correlate.

Risoluzione dei problemi di PDF in XML

SituazioneCosa controllare
L’XML non corrisponde allo schema di un fornitoreL’esportazione usa una propria struttura di estrazione. Crea una mappatura separata verso lo schema atteso dal sistema ricevente.
Un elemento ha un attributo encodingSe encoding è json, analizza il suo testo come una stringa JSON per recuperare i caratteri che non possono apparire direttamente in XML.
Mancano parole o l’ordine è inattesoControlla se sono presenti pagine scansionate o posizionamenti insoliti del testo. Applica OCR dove serve ed esamina le coordinate.

Domande frequenti

PDF in XML ripristina l’XML sorgente originale?

No. In genere un PDF non conserva il modello di dati sorgente. Questa esportazione registra il livello di testo e la geometria che il lettore può estrarre.

I tag del PDF diventano un modello di documento XML?

No. Lo strumento non ricostruisce la semantica del PDF con tag, i titoli o la struttura delle tabelle. I suoi elementi di pagina e testo descrivono i risultati di estrazione.

Posso riconvertire questo XML nello stesso PDF?

Lo strumento XML in PDF può stampare il sorgente XML, ma non ricrea l’impaginazione originale da questo file di estrazione. Conserva il PDF originale.

Strumenti correlati

XML in PDF, PDF in JSON, OCR PDF.