OCR PDF

Rendi le scansioni ricercabili, mantenendo l’aspetto originale delle pagine.

Seleziona file PDF

Trascina i file qui oppure usa il pulsante qui sotto.

Fino a 100 MB totali · I file restano sul tuo dispositivo

Indice12 sezioni

Quando un PDF ha bisogno dell’OCR?

Aggiungi un livello di testo ricercabile a un PDF scansionato con Tesseract eseguito nel browser. Scegli la lingua del sorgente; l’italiano è selezionato per impostazione predefinita. I lettori compatibili potranno cercare e selezionare le parole riconosciute, mentre la pagina scansionata manterrà il suo aspetto originale.

Per impostazione predefinita, l’operazione mantiene le pagine che contengono già testo. Puoi anche riconoscere ogni pagina selezionata: questo aggiunge un nuovo livello e può duplicare il testo esistente. L’accuratezza dell’OCR dipende da messa a fuoco, contrasto, lingua e allineamento delle pagine. Caratteri minuti, scrittura a mano, caratteri tipografici insoliti e scansioni con disturbi richiedono una revisione accurata, non fiducia automatica.

Funzioni di OCR PDF

PDF ricercabile o TXT

Scarica il testo riconosciuto come testo semplice oppure aggiungi un livello di testo sopra l’aspetto conservato della scansione in un PDF.

Fino a 20 pagine selezionate

Il download contiene solo le pagine selezionate. Scegli fino a 20 pagine; lascia vuoto Pagine per includere l’intero documento solo quando ha al massimo 20 pagine.

Controlli del riconoscimento

Scegli la lingua sorgente, 200 o 300 DPI, una rotazione per il riconoscimento e un layout automatico, a blocco singolo o con testo sparso. Le lingue supportate sono elencate nelle domande frequenti qui sotto.

Mantieni il testo esistente per impostazione predefinita

Le pagine che contengono già testo possono essere mantenute. Forza il riconoscimento solo dopo aver considerato la possibile duplicazione dei livelli di testo.

Perché aggiungere un livello di testo ricercabile a una scansione?

Una scansione memorizza la pagina come immagine, quindi una normale ricerca testuale non può trovare le parole stampate. L’OCR nella lingua selezionata può rendere ricercabile una scansione di testo dattiloscritto e fornire testo per copia e incolla o successive estrazioni. È particolarmente utile per gli archivi in cui trovare un nome o una frase noti conta più che riprogettare la pagina. Il livello riconosciuto può contenere errori anche quando la scansione appare nitida. Prova ricerca e selezione, quindi confronta nomi, riferimenti e numeri con l’immagine della pagina prima di usare il testo estratto.

Chi usa l’OCR sulle scansioni PDF?

Personale di biblioteche e archivi

Rendi un breve documento dattiloscritto ricercabile per titolo, nome o numero di riferimento. Conserva la scansione originale e prova quei termini nella copia scaricata, compresi i caratteri facili da confondere.

Studenti con dispense scansionate

Rendi ricercabili gli appunti dattiloscritti del corso prima di preparare gli appunti di studio. Le annotazioni scritte a mano possono restare inaffidabili, quindi controlla i passaggi citati rispetto alla scansione.

Addetti alle attività ordinarie di amministrazione del personale

Estrai il testo da una comunicazione scansionata approvata per un indice interno. Confronta con cura date, nomi del personale e numeri di riferimento, perché un solo carattere riconosciuto può cambiare un identificativo.

Come si rende ricercabile un PDF scansionato?

  1. Scegli una scansione non crittografata e seleziona al massimo 20 pagine. Il PDF scaricato contiene soltanto quella selezione. Inizia con un breve campione se non hai ancora usato questo tipo di scansione.
  2. Seleziona la lingua sorgente in Lingua del testo. Scegli PDF ricercabile o Estrai solo il testo, imposta la risoluzione del riconoscimento e seleziona una rotazione o una disposizione della pagina se la scansione ne ha bisogno.
  3. Mantieni il testo esistente per impostazione predefinita oppure scegli consapevolmente Riconosci ogni pagina selezionata. Avvia l’OCR e attendi la fine del riconoscimento.
  4. Scarica il risultato. Cerca una frase nota, copia una riga e confronta ortografia e numeri con la scansione originale.

Scegli il file di origine

Scegli una scansione in una lingua supportata e seleziona fino a 20 pagine.

Seleziona la schermata per ingrandirla.
OCR PDF, passaggio 1: Scegli una scansione in una lingua supportata e seleziona fino a 20 pagine.

Controlla le impostazioni dello strumento

Scegli la lingua di origine, il risultato OCR, la risoluzione, il layout e l’orientamento di riconoscimento.

Seleziona la schermata per ingrandirla.
OCR PDF, passaggio 2: Scegli la lingua di origine, il risultato OCR, la risoluzione, il layout e l’orientamento di riconoscimento.

Scarica e controlla il risultato

Scarica e verifica il testo riconosciuto confrontandolo con la scansione originale.

Seleziona la schermata per ingrandirla.
OCR PDF, passaggio 3: Scarica e verifica il testo riconosciuto confrontandolo con la scansione originale.

Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.

Una lista composta solo da immagini resa ricercabile

La pagina sorgente è un’immagine senza testo estraibile. L’OCR aggiunge un livello di testo mantenendo l’aspetto visibile della pagina. Le due immagini hanno quindi lo stesso aspetto; il risultato scaricabile contiene anche le parole riconosciute.

Prima: pagina composta solo da immagini

L’estrazione del testo dal sorgente ha restituito zero caratteri.

Lista effettiva composta solo da immagini prima dell’OCR, senza livello di testo selezionabile.

Dopo: stessa pagina, testo ricercabile

Il risultato contiene tutte e sei le righe di esempio. I pixel riprodotti corrispondono all’originale alla dimensione verificata di 1.300 pixel.

PDF ricercabile risultante effettivo con la stessa lista visibile e un nuovo livello di testo.
Testo sorgente
0 caratteri
Testo risultante
232 caratteri
Controllo del riconoscimento
6 righe di esempio su 6 (spazi e apostrofi normalizzati)
Leggi il testo estratto da questo risultato
LISTA PER IL LABORATORIO 
Conferma la disponibilità della sala. 
Stampa quaranta copie del materiale. 
Verifica 
il proiettore prima delle 09:00. 
La città scelta 
è Roma, lunedì mattina. 
Questo esempio non contiene dati personali.

Impostazioni utilizzate: Pagina 1; PDF ricercabile; riconoscimento a 200 DPI; blocco di testo singolo; italiano; orientamento originale.

Questo esempio italiano nitido e con caratteri grandi non è un parametro di accuratezza per testo piccolo, scrittura a mano, scansioni inclinate o altre lingue. Rileggi nomi, importi e date nel tuo risultato.

Verificato il . Esempi senza dati sensibili elaborati nell’edizione italiana del tema 3.11.0 con un browser Chromium locale. Questi esempi non costituiscono un test delle prestazioni di un hosting in produzione.

Impostazioni e controlli del risultato

ImpostazioneChe cosa aspettarsi
Formati di input accettatiPDF
Dove avviene l’elaborazioneNel tuo browser, sul tuo dispositivo
Selezione dei fileUn file di input
Dimensione dell’inputFino a 100 MB, entro i limiti della memoria del dispositivo e delle pagine decodificate
Gruppo di riconoscimentoFino a 20 pagine selezionate; solo quelle pagine compaiono nel PDF ricercabile scaricato.

Lo strumento aggiunge un livello di testo; non ricostruisce tabelle come fogli di calcolo modificabili e non corregge i contenuti fattuali. L’OCR non sostituisce il controllo di nomi, numeri di conto e altri testi che richiedono precisione.

Controllare l’orientamento del riconoscimento senza cambiare la scansione

L’impostazione di rotazione ruota la scansione riprodotta fornita al riconoscimento; il PDF ricercabile mantiene l’aspetto visibile della pagina sorgente. Non sostituisce Ruota PDF quando vuoi che i lettori vedano la pagina dritta. Se un livello di testo esistente contiene errori, forzare il riconoscimento può aggiungere un altro livello e produrre risultati di ricerca duplicati. In quella situazione, l’OCR in testo semplice può essere un’estrazione utile da verificare. Confronta con l’immagine caratteri facilmente confondibili come 0/O, 1/l e i punti decimali.

Risoluzione dei problemi di OCR PDF

SituazioneChe cosa fare
Un nome o un numero è sbagliatoConfronta il testo riconosciuto con l’immagine. Correggilo in un editor successivo adatto prima di riutilizzarlo.
Un livello OCR esistente errato non è miglioratoScegli Riconosci ogni pagina selezionata per aggiungere un livello nuovo. Il testo esistente viene conservato, quindi un livello già presente può produrre risultati di ricerca duplicati; esporta testo semplice se ti serve un’estrazione pulita.
Un fascicolo lungo viene rifiutatoSuddividilo in gruppi di al massimo 20 pagine, esegui l’OCR di ogni gruppo e verificali prima di unirli.

Un esempio pratico e i controlli finali

Per una scheda d’ispezione dattiloscritta, cerca un ID noto di un’apparecchiatura nel PDF ricercabile, quindi copia quell’ID e una misurazione in un editor di testo. Confronta entrambi con la scansione e verifica che la selezione evidenzi la riga desiderata. Il solo successo di una ricerca di parole non dimostra un ordine di lettura corretto o un’estrazione numerica affidabile.

Domande frequenti

L’OCR trasforma la pagina in contenuto Word modificabile?

Il risultato resta un PDF con un livello di testo aggiunto. Usa successivamente PDF in Word se serve un documento testuale con testo ridisposto.

Quali lingue sono disponibili?

Questa versione include modelli di riconoscimento per inglese, spagnolo, portoghese, tedesco, indonesiano, russo, francese, italiano, turco, arabo, cinese semplificato, giapponese, coreano, polacco e hindi. L’italiano è la lingua predefinita; seleziona la lingua corrispondente al sorgente. L’OCR riconosce i caratteri, ma non traduce il documento. Altre lingue richiedono una procedura OCR configurata separatamente.

Perché una pagina è stata saltata?

L’impostazione predefinita mantiene le pagine con un livello di testo esistente. Seleziona Riconosci ogni pagina selezionata per eseguire il riconoscimento anche su quelle.

Il risultato include pagine che non ho selezionato?

No. Il PDF ricercabile contiene solo le pagine selezionate. Per mantenere unito un documento lungo, riconosci gruppi fino a 20 pagine e combina i risultati verificati nel loro ordine originale.

La rotazione del riconoscimento ruoterà la pagina PDF visibile?

No. Ruota l’immagine fornita al riconoscimento mantenendo l’aspetto visibile della pagina sorgente nel PDF. Usa prima Ruota PDF quando la pagina salvata stessa deve apparire dritta.

Questo strumento può leggere in modo affidabile la scrittura a mano o ricostruire tabelle?

Lo strumento riconosce il testo nella lingua selezionata; non promette un riconoscimento affidabile della scrittura a mano e non ricostruisce le celle delle tabelle. Usa una scansione nitida e diritta di testo dattiloscritto e verifica le parole prima di portarle in Word o in un foglio di calcolo.

Strumenti e guide correlati

Prosegui con PDF in Word, PDF in testo, Scansioni in PDF. Per i requisiti di conservazione a lungo termine, consulta PDF in PDF/A; un PDF ricercabile non è automaticamente PDF/A.