Estrai il testo esistente
Leggi il livello di testo selezionabile del documento, anziché riconoscere le lettere nelle immagini scansionate.
Estrai il livello di testo esistente in un file di testo UTF-8.
Trascina i file qui oppure usa il pulsante qui sotto.
Fino a 100 MB totali · I file restano sul tuo dispositivo
Visualizza il documento qui. Per il contenuto aggiunto, questa anteprima serve da guida al posizionamento; controlla il file salvato.
Estrai il livello di testo esistente del PDF per cercarlo, copiarlo o modificarlo ulteriormente. Le righe vengono raggruppate in base alla loro posizione sulla pagina. È particolarmente utile per rapporti principalmente testuali e archivi documentali.
Il risultato contiene testo semplice senza caratteri tipografici, immagini o design della pagina. L’ordine di lettura nelle pagine a più colonne può differire dall’impaginazione visiva. Una pagina scansionata priva di livello di testo non può essere trascritta da questa operazione.
Leggi il livello di testo selezionabile del documento, anziché riconoscere le lettere nelle immagini scansionate.
Limita l’esportazione a un capitolo, una lettera o un’appendice usando il campo Pagine.
Scarica un file di testo semplice che si apre nei comuni editor di testo senza un’impaginazione da elaboratore di testi.
I frammenti di testo vicini vengono raggruppati in righe. L’ordine di lettura delle pagine a più colonne deve comunque essere verificato rispetto alla pagina.
Il testo semplice è utile quando le parole contano più dell’impaginazione stampata. Permette di cercare in una cartella locale, copiare il testo in un editor o preparare una base pulita per prendere appunti. Evita inoltre di trascinare un design di pagina ricco di immagini in un’attività testuale. Un livello di testo non è sempre identico a ciò che la pagina sembra dire: legature, errori OCR nascosti e ordine delle colonne possono alterare l’esportazione. Controlla paragrafi rappresentativi e nomi o numeri importanti prima di usare il risultato per altri lavori.
Esporta il testo di un articolo autorizzato per raccogliere citazioni e costruire appunti di lettura. Verifica ogni citazione rispetto alla pagina sorgente e annota separatamente il numero di pagina.
Sposta il testo di una lettera standard in un editor di testo per una bozza aggiornata. Controlla formule di apertura, date e ritorni a capo prima di trasferirlo nel modello dell’organizzazione.
Recupera il testo delle specifiche per un appunto di lavoro ricercabile. Confronta unità, simboli e passaggi numerati con il PDF, perché codifiche insolite dei caratteri possono cambiare quelli estratti.
Seleziona un PDF con un livello di testo selezionabile esistente.
Seleziona la schermata per ingrandirla.
Scegli le pagine e l’eventuale nome del file da scaricare.
Seleziona la schermata per ingrandirla.
Scarica il file TXT e verifica il testo confrontandolo con il PDF.
Seleziona la schermata per ingrandirla.
Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.
| Impostazione | Che cosa aspettarsi |
|---|---|
| Formati di input accettati | |
| Dove avviene l’elaborazione | Nel tuo browser |
| Selezione dei file | Un file di input |
| Dimensione dell’input | 100 MB totali; anche le immagini e le pagine decodificate hanno limiti di pixel |
| Selezione delle pagine | Fino a 200 pagine selezionate per operazione. Il campo Pagine vuoto indica tutte le pagine solo quando il PDF ne ha al massimo 200; per un documento più lungo usa intervalli separati. |
Se non è possibile selezionare alcun testo perché la pagina è una scansione, aggiungi e controlla un livello di testo OCR prima di usare l’estrazione del testo.
I frammenti di testo possono comparire nel PDF in un ordine diverso dalle loro posizioni visibili. Riquadri laterali, note a piè di pagina e impaginazioni a due colonne sono cause comuni dell’interruzione di una frase esportata. La lettera visibile può inoltre dipendere da una mappatura del carattere che non fornisce lo stesso carattere durante l’estrazione. Confronta un paragrafo che attraversa una colonna o un cambio pagina e controlla simboli tecnici e legature come “fi” prima di considerare il TXT un testo sorgente affidabile.
| Situazione | Che cosa fare |
|---|---|
| Il file di testo è vuoto o la conversione viene rifiutata | Le pagine selezionate potrebbero essere prive di un livello di testo. Usa prima l’OCR quando disponibile. |
| Alcune lettere sono errate | La codifica del testo o il livello OCR del PDF potrebbero essere difettosi. Confronta nomi, numeri e simboli con la pagina visibile. |
| Ti serve un documento formattato modificabile | Usa PDF in Word come punto di partenza DOCX; l’impaginazione esatta richiede comunque una revisione. |
Immagina due colonne con A1, A2 a sinistra e B1, B2 a destra. Il raggruppamento per posizione può produrre A1 B1 seguito da A2 B2, mescolando le colonne. Leggi ciascuna colonna nel PDF prima di riordinare le righe estratte: anche un file pulito può unire frasi non correlate.
Esegui prima l’OCR per aggiungere testo riconosciuto. Selezionando un sorgente composto solo da immagini, viene restituito un messaggio chiaro sull’assenza di testo.
Il raggruppamento delle righe in base alla posizione approssima l’ordine delle righe. Le interruzioni di paragrafo e le colonne complesse richiedono una revisione redazionale.
Il testo delle pagine selezionate viene unito con righe vuote. Conserva l’intervallo fisico delle pagine nei tuoi appunti se ti servono citazioni precise che rimandino al PDF.
Prosegui con OCR PDF, Lettore PDF. Per ottenere un risultato in un’altra lingua, leggi la procedura per tradurre un PDF; l’estrazione del testo da sola non traduce.