PDF in JSON

Esporta testo selezionabile, geometria delle pagine e posizioni del testo in JSON.

Seleziona file PDF

Trascina i file qui oppure usa il pulsante qui sotto.

Fino a 25 MB totali · I file restano sul tuo dispositivo

Indice10 sezioni

Cosa puoi estrarre da un PDF in JSON?

Trasforma il livello di testo di un PDF in un file JSON da esaminare o elaborare successivamente. L’esportazione registra le pagine selezionate, le loro dimensioni e gli elementi di testo restituiti dal lettore PDF, comprese posizioni e trasformazioni.

Un PDF memorizza istruzioni per visualizzare una pagina. Questo strumento non deduce i campi delle fatture, non ricostruisce tabelle e non identifica i livelli dei titoli originali. Le pagine scansionate richiedono OCR prima che le loro parole possano comparire nell’esportazione.

Funzioni di PDF in JSON

Selezione delle pagine

Esporta un intervallo specifico mantenendo i numeri di pagina originali. In questo modo è più semplice esaminare un piccolo campione prima di elaborare un documento lungo.

Testo con coordinate

Conserva gli elementi di testo insieme alla geometria delle pagine e alle informazioni di posizione. Usa il PDF originale per interpretare le coordinate e verificare le relazioni visive tra gli elementi.

Risultato leggibile dal software

Scarica JSON valido per il tuo analizzatore o processo di revisione. Il testo esportato viene sottoposto a escape come dato; lo strumento non esegue il contenuto del documento.

Elaborazione locale

Leggi il PDF selezionato nel browser. Il documento non viene inviato a un server di conversione e il file originale non viene modificato.

Come si converte il testo di un PDF in JSON?

  1. Scegli un PDF non crittografato il cui testo sia selezionabile in un lettore.
  2. Inserisci numeri di pagina come 1, 3-5, oppure lascia Pagine vuoto per includere tutte le pagine consentite.
  3. Avvia la conversione e scarica il file JSON.
  4. Aprilo in un visualizzatore o editor JSON e confronta una frase conosciuta con la pagina PDF corrispondente.
  5. Controlla coordinate, ordine di lettura ed eventuali pagine vuote prima di utilizzare i dati in un’altra applicazione.

Seleziona il PDF

Scegli un PDF contenente testo selezionabile.

Seleziona la schermata per ingrandirla.
PDF in JSON: selezione di un PDF di esempio con un livello di testo.

Scegli le pagine

Imposta l’intervallo di pagine e controlla i limiti di estrazione.

Seleziona la schermata per ingrandirla.
PDF in JSON: selezione delle pagine e impostazioni di estrazione.

Scarica il JSON

Salva il JSON e confrontalo con la pagina di origine.

Seleziona la schermata per ingrandirla.
PDF in JSON: download dell’esportazione di testo strutturato completata.

Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.

Perché esportare il testo PDF in JSON?

JSON è utile quando un flusso documentale richiede sia il testo sia la sua posizione. Uno sviluppatore può esaminare la qualità dell’estrazione, individuare etichette ripetute o preparare una mappatura separata. Definisci questa mappatura esplicitamente: un importo vicino non è automaticamente il totale di una fattura e l’ordine di estrazione non coincide necessariamente con quello di lettura umano.

Chi può usare questa esportazione?

Sviluppatori di soluzioni documentali

Esamina il livello di testo prima di creare un analizzatore e conserva i riferimenti di pagina per il debug.

Gruppi di revisione dei dati

Confronta i valori campione con la pagina di origine prima di accettare una regola di estrazione.

Studenti e ricercatori

Esplora come viene rappresentato il testo visibile in un documento a impaginazione fissa.

Impostazioni e controlli del risultato

ImpostazioneCosa aspettarsi
IngressoUn PDF fino a 25 MiB, con un massimo di 500 pagine di origine.
SelezioneFino a 200 pagine selezionate; al massimo 20.000 elementi di testo per pagina, 100.000 per elaborazione e due milioni di caratteri di testo.
UscitaJSON contenente testo estratto e geometria; massimo 64 MiB.
Pagine scansionateNessun OCR automatico, esportazione di immagini o riconoscimento dei campi del documento.

Controlla un piccolo campione prima di creare un analizzatore

Per un prospetto a due colonne, esporta prima una pagina. Individua un’etichetta conosciuta e confrontane la posizione con il valore stampato. Se gli elementi delle due colonne sono mescolati, raggruppali mediante le coordinate nel tuo codice anziché considerare l’array come una tabella già pronta.

Risoluzione dei problemi di PDF in JSON

SituazioneCosa controllare
Non viene trovato testo selezionabileEsegui OCR sulle pagine scansionate, quindi esporta il livello di testo del PDF ottenuto.
Il testo compare in un ordine inattesoConfronta la pagina e le posizioni del testo: l’ordine di estrazione non definisce quello di lettura.
Una selezione grande viene rifiutataScegli meno pagine. Le pagine dense possono raggiungere il limite degli elementi di testo prima di quello delle pagine.

Domande frequenti

PDF in JSON riconosce i campi delle fatture?

No. Il risultato contiene elementi di testo e geometria. Nomi dei campi, relazioni e validazione delle regole aziendali richiedono una mappatura separata.

Sono incluse immagini e tabelle?

Le immagini non vengono esportate. Il testo di una tabella può essere estratto, ma le relazioni tra righe e colonne non vengono ricostruite.

Posso ricreare il PDF originale da questo JSON?

L’esportazione è un formato di analisi, non una rappresentazione completa del PDF. Conserva il PDF originale per aspetto, grafica, caratteri e funzioni interattive.

Strumenti correlati

JSON in PDF, PDF in XML, OCR PDF.