Una sezione per ogni pagina sorgente
L’HTML identifica le pagine sorgente selezionate, così che il lettore possa tornare alla pagina PDF corrispondente.
Crea un documento HTML semplice dal livello di testo PDF.
Trascina i file qui oppure usa il pulsante qui sotto.
Fino a 100 MB totali · I file restano sul tuo dispositivo
Visualizza il documento qui. Per il contenuto aggiunto, questa anteprima serve da guida al posizionamento; controlla il file salvato.
Esporta il testo PDF selezionabile in un semplice documento HTML con una sezione per ogni pagina selezionata. Il risultato è utile come riferimento testuale leggibile o come base per la redazione web.
Lo strumento esegue l’escape dei caratteri estratti e non ricrea contenuti PDF interattivi o CSS originali. Il risultato è una rappresentazione testuale, non una versione web del PDF identica a livello di pixel.
L’HTML identifica le pagine sorgente selezionate, così che il lettore possa tornare alla pagina PDF corrispondente.
I caratteri estratti vengono sottoposti a escape per HTML. Il testo PDF non viene eseguito come codice HTML incorporato.
Crea un documento di riferimento più piccolo scegliendo solo le pagine pertinenti alla tua attività.
Il file scaricato si apre come documento testuale HTML. Non riproduce caratteri, immagini o CSS della pagina sorgente.
HTML può rendere il testo estratto comodo da visualizzare nel browser o da consegnare a un redattore web. Questo convertitore crea sezioni testuali etichettate per pagina, utili come riferimento mentre un editore costruisce una vera pagina web. Non deduce titoli semantici, non ricrea tabelle e non fornisce una pubblicazione accessibile completa. Dopo la conversione, riorganizza i contenuti in titoli e paragrafi significativi, verifica l’ordine di lettura e aggiungi separatamente le immagini autorizzate. Usa invece il rendering delle pagine quando serve un’anteprima visiva fissa.
Recupera il testo approvato di una brochure per una bozza di pagina web. Sostituisci le sezioni generiche delle pagine con titoli significativi e verifica che i ritorni a capo non abbiano spezzato le frasi.
Crea un riferimento leggibile nel browser da una procedura PDF principalmente testuale. Conserva i riferimenti alle pagine sorgente mentre prepari un articolo revisionato per il sistema del team.
Confronta l’impaginazione fissa di un PDF con una semplice rappresentazione testuale HTML. Individua quali strutture, descrizioni delle immagini e markup delle tabelle debbano essere aggiunti manualmente per un’edizione web utilizzabile.
Scegli un PDF basato su testo per l’estrazione in HTML.
Seleziona la schermata per ingrandirla.
Imposta le pagine di origine e l’eventuale nome del file da scaricare.
Seleziona la schermata per ingrandirla.
Scarica l’HTML e controlla le sezioni di testo etichettate per pagina.
Seleziona la schermata per ingrandirla.
Le schermate mostrano questo toolkit con file di esempio privi di dati sensibili. Il nome del file, il numero di pagine e le impostazioni possono differire.
| Impostazione | Che cosa aspettarsi |
|---|---|
| Formati di input accettati | |
| Dove avviene l’elaborazione | Nel tuo browser |
| Selezione dei file | Un file di input |
| Dimensione dell’input | 100 MB totali; anche le immagini e le pagine decodificate hanno limiti di pixel |
| Selezione delle pagine | Fino a 200 pagine selezionate per operazione. Il campo Pagine vuoto indica tutte le pagine solo quando il PDF ne ha al massimo 200; per un documento più lungo usa intervalli separati. |
Questa esportazione richiede un livello di testo esistente. Le pagine scansionate richiedono un OCR verificato prima che il loro testo possa comparire nell’HTML generato.
Un cambio di pagina stampata raramente identifica una sezione web completa. Quando modifichi l’esportazione, disponi i paragrafi sotto titoli che ne descrivano l’argomento, assegna alle vere tabelle il corretto markup di righe e colonne e fornisci testo esplicativo per i diagrammi importanti. Il testo preformattato generato è un riferimento da modificare, non la prova che il documento originale sia ora una pagina web finita. Controlla il testo rispetto al PDF prima di rimuovere le etichette delle pagine sorgente.
| Situazione | Che cosa fare |
|---|---|
| Manca il design della pagina | È un’esportazione del testo PDF in HTML, non una ricostruzione dell’impaginazione visiva. |
| Una pagina scansionata non ha contenuti | Aggiungi e verifica prima un livello di testo OCR. |
| I caratteri sembrano codice HTML | Vengono deliberatamente sottoposti a escape, affinché il contenuto documentale estratto non venga eseguito. |
Un titolo stampato come “Piano del progetto” può finire nel testo pre esportato. Dopo aver confermato che è il titolo del documento, un editor può marcarlo come <h1>Piano del progetto</h1> e mettere la prosa successiva in elementi p. Scegli la struttura in base al significato, non soltanto alla fine della pagina PDF.
Questa esportazione include il testo estratto sottoposto a escape. Immagini, collegamenti attivi e stile originale delle pagine non vengono ricostruiti.
Controlla prima contenuti, accessibilità e formattazione. Aggiungi un’impaginazione web adatta, senza considerare il testo estratto un sito completo.
Sì. Apri il file scaricato in un editor di testo o HTML. Controlla i caratteri estratti e aggiungi una struttura adatta prima di usarlo in una pagina pubblicata.
Prosegui con HTML in PDF, OCR PDF, PDF in testo.