PDF en XML

Extrayez les éléments de texte PDF et la géométrie des pages dans une structure XML documentée.

Sélectionner des fichiers PDF

Déposez les fichiers ici ou utilisez le bouton ci-dessous.

Jusqu’à 25 Mo au total · Les fichiers restent sur votre appareil

Sommaire10 sections

Que contient l’export XML ?

Exportez la couche de texte sélectionnable d’un PDF en XML. Le fichier regroupe les éléments de texte sous leurs numéros de page d’origine et enregistre la géométrie des pages, la direction du texte et les transformations de position. Il fournit des données structurées pour l’inspection et les traitements ultérieurs.

Le XML décrit ce que le lecteur de texte PDF a extrait. Ce n’est pas le XML original qui a éventuellement servi à produire le document, et il n’identifie pas les champs de facture, ne reconstitue pas les relations des tableaux et n’exporte pas les images. Les pages constituées uniquement d’images nécessitent d’abord un OCR.

Fonctions de PDF en XML

Éléments organisés par page

Conservez les numéros des pages source, leur rotation et leurs limites visibles avec le texte extrait. Cela garde une référence utile lors de l’examen d’une plage sélectionnée.

Valeurs textuelles échappées

Les caractères comme les esperluettes et les chevrons restent des données dans les éléments XML. Un texte ressemblant à du balisage ne peut pas devenir du contenu de page exécutable par cet export.

Chaînes exceptionnelles réversibles

Les caractères que XML ne peut pas représenter directement utilisent un encodage de chaîne JSON explicitement signalé. Ce marqueur permet au programme destinataire de retrouver précisément les valeurs.

Traitement dans le navigateur

Créez le fichier XML sur votre appareil. La source n’est ni envoyée pour conversion ni réécrite.

Comment extraire du XML d’un PDF ?

  1. Sélectionnez un PDF non chiffré contenant du texte sélectionnable.
  2. Saisissez les numéros ou plages nécessaires dans Pages.
  3. Convertissez le fichier et téléchargez le résultat XML.
  4. Ouvrez le XML dans un éditeur de texte ou une application compatible XML.
  5. Comparez une page et une phrase connues avant d’associer les éléments à un autre système.

Choisissez le PDF source

Sélectionnez un PDF doté d’une couche de texte lisible.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en XML : sélection d’un PDF source.

Limitez la plage de pages

Choisissez les pages nécessaires à l’extraction XML.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en XML : plage de pages et limites d’extraction.

Enregistrez le XML

Téléchargez le XML et examinez ses éléments de page.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en XML : téléchargement de l’export XML terminé.

Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.

Pourquoi utiliser XML pour inspecter le texte d’un PDF ?

Un processus XML peut nécessiter des éléments explicites de page et de texte avant d’appliquer ses propres règles de transformation. Une équipe peut inspecter ces éléments, conserver les références aux pages source et créer une correspondance distincte pour les types de documents connus. Séparez cette correspondance de l’extraction : la proximité de deux éléments de texte ne définit pas à elle seule une relation métier.

Qui peut exploiter cette sortie XML ?

Développeurs d’intégrations

Utilisez les éléments de page et de texte comme entrées d’un processus de traitement documentaire contrôlé.

Archivistes documentaires

Examinez si le texte reste disponible aux côtés du PDF original conservé.

Auditeurs de données

Comparez des valeurs échantillonnées à leurs pages source avant d’adopter les règles de transformation.

Réglages et vérifications du résultat

RéglageRésultat attendu
SourceUn PDF de 25 MiB maximum avec au plus 500 pages source.
Plage de pagesJusqu’à 200 pages sélectionnées. Une plage vide inclut toutes les pages seulement si cette limite est respectée.
Limites de texteJusqu’à 20 000 éléments par page, 100 000 par traitement et deux millions de caractères de texte.
TéléchargementUn document XML de 64 MiB maximum. Aucune DTD ni aucun schéma externe n’est demandé.

Associez un libellé connu après avoir vérifié la page

Pour un document de livraison, exportez une page et repérez un numéro de référence connu. Comparez sa transformation de texte et les éléments voisins à la page d’origine. Votre application peut ensuite appliquer une règle à ce type de document. Évitez de traiter tous les nombres voisins comme le même champ dans des présentations sans rapport.

Résoudre les problèmes de PDF en XML

SituationPoints à vérifier
Le XML ne correspond pas au schéma d’un fournisseurL’export utilise sa propre structure d’extraction. Créez une correspondance distincte avec le schéma attendu par votre système destinataire.
Un élément possède un attribut encodingSi encoding vaut json, analysez son texte comme une chaîne JSON pour retrouver les caractères qui ne peuvent pas figurer directement en XML.
Des mots manquent ou leur ordre est inattenduVérifiez la présence de pages numérisées ou de positions de texte inhabituelles. Appliquez l’OCR au besoin et examinez les coordonnées.

Questions fréquentes

PDF en XML restitue-t-il le XML source d’origine ?

Non. Un PDF ne conserve généralement pas le modèle de données source. Cet export enregistre la couche de texte et la géométrie que le lecteur peut extraire.

Les balises PDF sont-elles converties en modèle de document XML ?

Non. L’outil ne reconstitue pas la sémantique du PDF balisé, les titres ni la structure des tableaux. Ses éléments de page et de texte décrivent les résultats d’extraction.

Puis-je reconvertir ce XML dans le même PDF ?

L’outil XML en PDF peut imprimer le code XML, mais il ne peut pas recréer la présentation d’origine à partir de ce fichier d’extraction. Conservez le PDF original.

Outils associés

XML en PDF, PDF en JSON, OCR PDF.