PDF ricercabile o TXT
Scarica il testo riconosciuto come testo semplice oppure aggiungi un livello di testo sopra l’aspetto conservato della scansione in un PDF.
Rendi le scansioni ricercabili, mantenendo l’aspetto originale delle pagine.
Trascina i file qui oppure usa il pulsante qui sotto.
Fino a 100 MB totali · I file restano sul tuo dispositivo
Visualizza il documento qui. Per il contenuto aggiunto, questa anteprima serve da guida al posizionamento; controlla il file salvato.
Aggiungi un livello di testo ricercabile a un PDF scansionato con Tesseract eseguito nel browser. Scegli la lingua del sorgente; l’italiano è selezionato per impostazione predefinita. I lettori compatibili potranno cercare e selezionare le parole riconosciute, mentre la pagina scansionata manterrà il suo aspetto originale.
Per impostazione predefinita, l’operazione mantiene le pagine che contengono già testo. Puoi anche riconoscere ogni pagina selezionata: questo aggiunge un nuovo livello e può duplicare il testo esistente. L’accuratezza dell’OCR dipende da messa a fuoco, contrasto, lingua e allineamento delle pagine. Caratteri minuti, scrittura a mano, caratteri tipografici insoliti e scansioni con disturbi richiedono una revisione accurata, non fiducia automatica.
Scarica il testo riconosciuto come testo semplice oppure aggiungi un livello di testo sopra l’aspetto conservato della scansione in un PDF.
Il download contiene solo le pagine selezionate. Scegli fino a 20 pagine; lascia vuoto Pagine per includere l’intero documento solo quando ha al massimo 20 pagine.
Scegli la lingua sorgente, 200 o 300 DPI, una rotazione per il riconoscimento e un layout automatico, a blocco singolo o con testo sparso. Le lingue supportate sono elencate nelle domande frequenti qui sotto.
Le pagine che contengono già testo possono essere mantenute. Forza il riconoscimento solo dopo aver considerato la possibile duplicazione dei livelli di testo.
Una scansione memorizza la pagina come immagine, quindi una normale ricerca testuale non può trovare le parole stampate. L’OCR nella lingua selezionata può rendere ricercabile una scansione di testo dattiloscritto e fornire testo per copia e incolla o successive estrazioni. È particolarmente utile per gli archivi in cui trovare un nome o una frase noti conta più che riprogettare la pagina. Il livello riconosciuto può contenere errori anche quando la scansione appare nitida. Prova ricerca e selezione, quindi confronta nomi, riferimenti e numeri con l’immagine della pagina prima di usare il testo estratto.
Rendi un breve documento dattiloscritto ricercabile per titolo, nome o numero di riferimento. Conserva la scansione originale e prova quei termini nella copia scaricata, compresi i caratteri facili da confondere.
Rendi ricercabili gli appunti dattiloscritti del corso prima di preparare gli appunti di studio. Le annotazioni scritte a mano possono restare inaffidabili, quindi controlla i passaggi citati rispetto alla scansione.
Estrai il testo da una comunicazione scansionata approvata per un indice interno. Confronta con cura date, nomi del personale e numeri di riferimento, perché un solo carattere riconosciuto può cambiare un identificativo.
Scegli una scansione in una lingua supportata e seleziona fino a 20 pagine.
Seleziona la schermata per ingrandirla.
Scegli la lingua di origine, il risultato OCR, la risoluzione, il layout e l’orientamento di riconoscimento.
Seleziona la schermata per ingrandirla.
Scarica e verifica il testo riconosciuto confrontandolo con la scansione originale.
Seleziona la schermata per ingrandirla.
Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.
La pagina sorgente è un’immagine senza testo estraibile. L’OCR aggiunge un livello di testo mantenendo l’aspetto visibile della pagina. Le due immagini hanno quindi lo stesso aspetto; il risultato scaricabile contiene anche le parole riconosciute.
L’estrazione del testo dal sorgente ha restituito zero caratteri.

Il risultato contiene tutte e sei le righe di esempio. I pixel riprodotti corrispondono all’originale alla dimensione verificata di 1.300 pixel.

LISTA PER IL LABORATORIO Conferma la disponibilità della sala. Stampa quaranta copie del materiale. Verifica il proiettore prima delle 09:00. La città scelta è Roma, lunedì mattina. Questo esempio non contiene dati personali.
Impostazioni utilizzate: Pagina 1; PDF ricercabile; riconoscimento a 200 DPI; blocco di testo singolo; italiano; orientamento originale.
Questo esempio italiano nitido e con caratteri grandi non è un parametro di accuratezza per testo piccolo, scrittura a mano, scansioni inclinate o altre lingue. Rileggi nomi, importi e date nel tuo risultato.
Verificato il . Esempi senza dati sensibili elaborati nell’edizione italiana del tema 3.11.0 con un browser Chromium locale. Questi esempi non costituiscono un test delle prestazioni di un hosting in produzione.
| Impostazione | Che cosa aspettarsi |
|---|---|
| Formati di input accettati | |
| Dove avviene l’elaborazione | Nel tuo browser, sul tuo dispositivo |
| Selezione dei file | Un file di input |
| Dimensione dell’input | Fino a 100 MB, entro i limiti della memoria del dispositivo e delle pagine decodificate |
| Gruppo di riconoscimento | Fino a 20 pagine selezionate; solo quelle pagine compaiono nel PDF ricercabile scaricato. |
Lo strumento aggiunge un livello di testo; non ricostruisce tabelle come fogli di calcolo modificabili e non corregge i contenuti fattuali. L’OCR non sostituisce il controllo di nomi, numeri di conto e altri testi che richiedono precisione.
L’impostazione di rotazione ruota la scansione riprodotta fornita al riconoscimento; il PDF ricercabile mantiene l’aspetto visibile della pagina sorgente. Non sostituisce Ruota PDF quando vuoi che i lettori vedano la pagina dritta. Se un livello di testo esistente contiene errori, forzare il riconoscimento può aggiungere un altro livello e produrre risultati di ricerca duplicati. In quella situazione, l’OCR in testo semplice può essere un’estrazione utile da verificare. Confronta con l’immagine caratteri facilmente confondibili come 0/O, 1/l e i punti decimali.
| Situazione | Che cosa fare |
|---|---|
| Un nome o un numero è sbagliato | Confronta il testo riconosciuto con l’immagine. Correggilo in un editor successivo adatto prima di riutilizzarlo. |
| Un livello OCR esistente errato non è migliorato | Scegli Riconosci ogni pagina selezionata per aggiungere un livello nuovo. Il testo esistente viene conservato, quindi un livello già presente può produrre risultati di ricerca duplicati; esporta testo semplice se ti serve un’estrazione pulita. |
| Un fascicolo lungo viene rifiutato | Suddividilo in gruppi di al massimo 20 pagine, esegui l’OCR di ogni gruppo e verificali prima di unirli. |
Per una scheda d’ispezione dattiloscritta, cerca un ID noto di un’apparecchiatura nel PDF ricercabile, quindi copia quell’ID e una misurazione in un editor di testo. Confronta entrambi con la scansione e verifica che la selezione evidenzi la riga desiderata. Il solo successo di una ricerca di parole non dimostra un ordine di lettura corretto o un’estrazione numerica affidabile.
Il risultato resta un PDF con un livello di testo aggiunto. Usa successivamente PDF in Word se serve un documento testuale con testo ridisposto.
Questa versione include modelli di riconoscimento per inglese, spagnolo, portoghese, tedesco, indonesiano, russo, francese, italiano, turco, arabo, cinese semplificato, giapponese, coreano, polacco e hindi. L’italiano è la lingua predefinita; seleziona la lingua corrispondente al sorgente. L’OCR riconosce i caratteri, ma non traduce il documento. Altre lingue richiedono una procedura OCR configurata separatamente.
L’impostazione predefinita mantiene le pagine con un livello di testo esistente. Seleziona Riconosci ogni pagina selezionata per eseguire il riconoscimento anche su quelle.
No. Il PDF ricercabile contiene solo le pagine selezionate. Per mantenere unito un documento lungo, riconosci gruppi fino a 20 pagine e combina i risultati verificati nel loro ordine originale.
No. Ruota l’immagine fornita al riconoscimento mantenendo l’aspetto visibile della pagina sorgente nel PDF. Usa prima Ruota PDF quando la pagina salvata stessa deve apparire dritta.
Lo strumento riconosce il testo nella lingua selezionata; non promette un riconoscimento affidabile della scrittura a mano e non ricostruisce le celle delle tabelle. Usa una scansione nitida e diritta di testo dattiloscritto e verifica le parole prima di portarle in Word o in un foglio di calcolo.
Prosegui con PDF in Word, PDF in testo, Scansioni in PDF. Per i requisiti di conservazione a lungo termine, consulta PDF in PDF/A; un PDF ricercabile non è automaticamente PDF/A.