Une section par page source
Le HTML identifie les pages sources sélectionnées pour que le lecteur puisse retrouver la page PDF correspondante.
Créez un document HTML simple à partir de la couche de texte du PDF.
Déposez les fichiers ici ou utilisez le bouton ci-dessous.
Jusqu’à 100 Mo au total · Les fichiers restent sur votre appareil
Visualisez le document ici. Pour le contenu ajouté, cet aperçu sert de guide de placement ; vérifiez le fichier enregistré.
Exportez le texte sélectionnable d’un PDF dans un document HTML simple avec une section pour chaque page sélectionnée. Le résultat est utile comme référence textuelle lisible ou comme point de départ pour une adaptation au web.
L’outil échappe les caractères extraits et ne recrée ni le contenu PDF interactif ni le CSS d’origine. Le résultat est une représentation textuelle plutôt qu’une version web du PDF reproduite au pixel près.
Le HTML identifie les pages sources sélectionnées pour que le lecteur puisse retrouver la page PDF correspondante.
Les caractères extraits sont échappés pour le HTML. Le texte du PDF n’est pas exécuté comme du code HTML intégré.
Créez un document de référence plus petit en choisissant uniquement les pages pertinentes pour votre tâche.
Le fichier téléchargé s’ouvre comme un document textuel HTML. Il ne reproduit pas les polices, les images ni le CSS des pages sources.
Le HTML facilite la consultation du texte extrait dans un navigateur ou sa transmission à un éditeur web. Ce convertisseur crée des sections textuelles identifiées par page, utiles comme référence pendant la création d’une véritable page web. Il ne déduit pas les titres sémantiques, ne recrée pas les tableaux et ne fournit pas une publication accessible complète. Après conversion, restructurez le contenu en titres et paragraphes significatifs, vérifiez l’ordre de lecture et ajoutez séparément les images autorisées. Utilisez plutôt le rendu des pages lorsqu’un aperçu visuel fixe est nécessaire.
Récupérez le texte approuvé d’une brochure pour un brouillon de page web. Remplacez les sections de pages génériques par des titres pertinents et vérifiez que les retours à la ligne n’ont pas coupé les phrases.
Créez une référence lisible dans un navigateur à partir d’une procédure PDF essentiellement textuelle. Conservez les références aux pages sources pendant la préparation d’un article relu pour le système de l’équipe.
Comparez la mise en page fixe du PDF avec une représentation textuelle HTML simple. Déterminez la structure, les descriptions d’images et le balisage de tableaux qu’il faut fournir manuellement pour obtenir une version web utilisable.
Choisissez un PDF textuel pour l’extraction HTML.
Sélectionnez la capture d’écran pour l’agrandir.
Définissez les pages sources et, si souhaité, le nom du téléchargement.
Sélectionnez la capture d’écran pour l’agrandir.
Téléchargez le HTML et vérifiez ses sections de texte portant les repères de pages.
Sélectionnez la capture d’écran pour l’agrandir.
Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.
| Réglage | À quoi s’attendre |
|---|---|
| Formats acceptés | |
| Lieu du traitement | Votre navigateur |
| Sélection des fichiers | Un fichier source |
| Taille des fichiers sources | 100 Mo au total ; les images et les pages décodées sont également soumises à des limites de pixels |
| Sélection des pages | Jusqu’à 200 pages sélectionnées par traitement. Un champ « Pages » vide signifie toutes les pages uniquement si le PDF contient 200 pages ou moins ; utilisez des plages séparées pour un document plus long. |
Cet export nécessite une couche de texte existante. Les pages numérisées exigent un OCR vérifié avant que leur texte puisse apparaître dans le HTML généré.
La limite d’une page imprimée correspond rarement à une section web complète. Lors de la modification de l’export, placez les paragraphes sous des titres qui décrivent leur sujet, donnez aux vrais tableaux un balisage de lignes et de colonnes adapté et fournissez un texte explicatif pour les schémas importants. Le texte préformaté généré est une référence à modifier, et non la preuve que le document d’origine est devenu une page web finalisée. Vérifiez le texte par rapport au PDF avant de retirer les libellés des pages sources.
| Situation | Que faire |
|---|---|
| La présentation de la page a disparu | Il s’agit d’un export du texte du PDF en HTML, et non d’une reconstitution de la mise en page visuelle. |
| Une page numérisée n’a aucun contenu | Ajoutez et vérifiez d’abord une couche de texte OCR. |
| Des caractères ressemblent à du code HTML | Ils sont volontairement échappés pour que le contenu extrait du document ne soit pas exécuté. |
Un titre imprimé comme « Plan du projet » peut se retrouver dans le texte pre exporté. Après avoir confirmé son rôle de titre du document, un éditeur peut le baliser avec <h1>Plan du projet</h1> et placer le texte suivant dans des éléments p. Choisissez la structure selon le sens, pas seulement selon la fin d’une page PDF.
Cet export comprend le texte extrait échappé. Les images, les liens actifs et les styles d’origine de la page ne sont pas recréés.
Vérifiez d’abord son contenu, son accessibilité et sa mise en forme. Ajoutez une mise en page web adaptée au lieu de considérer le texte extrait comme un site complet.
Oui. Ouvrez le fichier téléchargé dans un éditeur de texte ou de HTML. Vérifiez les caractères extraits et ajoutez une structure adaptée avant de l’utiliser dans une page publiée.
Poursuivez avec HTML en PDF, Reconnaissance de texte (OCR), PDF en texte.