PDF in testo

Estrai il livello di testo esistente in un file di testo UTF-8.

Seleziona file PDF

Trascina i file qui oppure usa il pulsante qui sotto.

Fino a 100 MB totali · I file restano sul tuo dispositivo

Indice11 sezioni

Che cosa si può estrarre da un PDF come testo semplice?

Estrai il livello di testo esistente del PDF per cercarlo, copiarlo o modificarlo ulteriormente. Le righe vengono raggruppate in base alla loro posizione sulla pagina. È particolarmente utile per rapporti principalmente testuali e archivi documentali.

Il risultato contiene testo semplice senza caratteri tipografici, immagini o design della pagina. L’ordine di lettura nelle pagine a più colonne può differire dall’impaginazione visiva. Una pagina scansionata priva di livello di testo non può essere trascritta da questa operazione.

Funzioni di PDF in testo

Estrai il testo esistente

Leggi il livello di testo selezionabile del documento, anziché riconoscere le lettere nelle immagini scansionate.

Scegli le pagine pertinenti

Limita l’esportazione a un capitolo, una lettera o un’appendice usando il campo Pagine.

Output TXT portabile

Scarica un file di testo semplice che si apre nei comuni editor di testo senza un’impaginazione da elaboratore di testi.

Raggruppamento delle righe in base alla posizione

I frammenti di testo vicini vengono raggruppati in righe. L’ordine di lettura delle pagine a più colonne deve comunque essere verificato rispetto alla pagina.

Perché convertire il contenuto di un PDF in un file di testo?

Il testo semplice è utile quando le parole contano più dell’impaginazione stampata. Permette di cercare in una cartella locale, copiare il testo in un editor o preparare una base pulita per prendere appunti. Evita inoltre di trascinare un design di pagina ricco di immagini in un’attività testuale. Un livello di testo non è sempre identico a ciò che la pagina sembra dire: legature, errori OCR nascosti e ordine delle colonne possono alterare l’esportazione. Controlla paragrafi rappresentativi e nomi o numeri importanti prima di usare il risultato per altri lavori.

Chi usa il testo estratto dai PDF?

Ricercatori universitari

Esporta il testo di un articolo autorizzato per raccogliere citazioni e costruire appunti di lettura. Verifica ogni citazione rispetto alla pagina sorgente e annota separatamente il numero di pagina.

Impiegati amministrativi

Sposta il testo di una lettera standard in un editor di testo per una bozza aggiornata. Controlla formule di apertura, date e ritorni a capo prima di trasferirlo nel modello dell’organizzazione.

Redattori tecnici

Recupera il testo delle specifiche per un appunto di lavoro ricercabile. Confronta unità, simboli e passaggi numerati con il PDF, perché codifiche insolite dei caratteri possono cambiare quelli estratti.

Come si estrae il testo da un PDF?

  1. Scegli un PDF con testo selezionabile. Se è una scansione composta solo da immagini, crea prima un livello di testo con l’OCR.
  2. Inserisci le pagine da estrarre oppure lascia vuoto Pagine per l’intero documento. Aggiungi un nome del file da scaricare, se utile.
  3. Esegui l’estrazione e scarica il file TXT. Aprilo in un editor di testo.
  4. Confronta ordine dei paragrafi, punteggiatura, nomi e numeri importanti con il PDF originale prima di modificare o citare il testo.

Scegli il file di origine

Seleziona un PDF con un livello di testo selezionabile esistente.

Seleziona la schermata per ingrandirla.
PDF in testo, passaggio 1: Seleziona un PDF con un livello di testo selezionabile esistente.

Controlla le impostazioni dello strumento

Scegli le pagine e l’eventuale nome del file da scaricare.

Seleziona la schermata per ingrandirla.
PDF in testo, passaggio 2: Scegli le pagine e l’eventuale nome del file da scaricare.

Scarica e controlla il risultato

Scarica il file TXT e verifica il testo confrontandolo con il PDF.

Seleziona la schermata per ingrandirla.
PDF in testo, passaggio 3: Scarica il file TXT e verifica il testo confrontandolo con il PDF.

Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.

Impostazioni e controlli del risultato

ImpostazioneChe cosa aspettarsi
Formati di input accettatiPDF
Dove avviene l’elaborazioneNel tuo browser
Selezione dei fileUn file di input
Dimensione dell’input100 MB totali; anche le immagini e le pagine decodificate hanno limiti di pixel
Selezione delle pagineFino a 200 pagine selezionate per operazione. Il campo Pagine vuoto indica tutte le pagine solo quando il PDF ne ha al massimo 200; per un documento più lungo usa intervalli separati.

Se non è possibile selezionare alcun testo perché la pagina è una scansione, aggiungi e controlla un livello di testo OCR prima di usare l’estrazione del testo.

Controllare ordine di lettura e caratteri codificati

I frammenti di testo possono comparire nel PDF in un ordine diverso dalle loro posizioni visibili. Riquadri laterali, note a piè di pagina e impaginazioni a due colonne sono cause comuni dell’interruzione di una frase esportata. La lettera visibile può inoltre dipendere da una mappatura del carattere che non fornisce lo stesso carattere durante l’estrazione. Confronta un paragrafo che attraversa una colonna o un cambio pagina e controlla simboli tecnici e legature come “fi” prima di considerare il TXT un testo sorgente affidabile.

Risoluzione dei problemi di PDF in testo

SituazioneChe cosa fare
Il file di testo è vuoto o la conversione viene rifiutataLe pagine selezionate potrebbero essere prive di un livello di testo. Usa prima l’OCR quando disponibile.
Alcune lettere sono errateLa codifica del testo o il livello OCR del PDF potrebbero essere difettosi. Confronta nomi, numeri e simboli con la pagina visibile.
Ti serve un documento formattato modificabileUsa PDF in Word come punto di partenza DOCX; l’impaginazione esatta richiede comunque una revisione.

Un esempio pratico e i controlli finali

Immagina due colonne con A1, A2 a sinistra e B1, B2 a destra. Il raggruppamento per posizione può produrre A1 B1 seguito da A2 B2, mescolando le colonne. Leggi ciascuna colonna nel PDF prima di riordinare le righe estratte: anche un file pulito può unire frasi non correlate.

Domande frequenti

Posso estrarre testo da un PDF scansionato?

Esegui prima l’OCR per aggiungere testo riconosciuto. Selezionando un sorgente composto solo da immagini, viene restituito un messaggio chiaro sull’assenza di testo.

Lo strumento conserva i paragrafi?

Il raggruppamento delle righe in base alla posizione approssima l’ordine delle righe. Le interruzioni di paragrafo e le colonne complesse richiedono una revisione redazionale.

Come vengono separate le pagine nel testo scaricato?

Il testo delle pagine selezionate viene unito con righe vuote. Conserva l’intervallo fisico delle pagine nei tuoi appunti se ti servono citazioni precise che rimandino al PDF.

Strumenti e guide correlati

Prosegui con OCR PDF, Lettore PDF. Per ottenere un risultato in un’altra lingua, leggi la procedura per tradurre un PDF; l’estrazione del testo da sola non traduce.