Éléments organisés par page
Conservez les numéros des pages source, leur rotation et leurs limites visibles avec le texte extrait. Cela garde une référence utile lors de l’examen d’une plage sélectionnée.
Extrayez les éléments de texte PDF et la géométrie des pages dans une structure XML documentée.
Déposez les fichiers ici ou utilisez le bouton ci-dessous.
Jusqu’à 25 Mo au total · Les fichiers restent sur votre appareil
Visualisez le document ici. Pour le contenu ajouté, cet aperçu sert de guide de placement ; vérifiez le fichier enregistré.
Exportez la couche de texte sélectionnable d’un PDF en XML. Le fichier regroupe les éléments de texte sous leurs numéros de page d’origine et enregistre la géométrie des pages, la direction du texte et les transformations de position. Il fournit des données structurées pour l’inspection et les traitements ultérieurs.
Le XML décrit ce que le lecteur de texte PDF a extrait. Ce n’est pas le XML original qui a éventuellement servi à produire le document, et il n’identifie pas les champs de facture, ne reconstitue pas les relations des tableaux et n’exporte pas les images. Les pages constituées uniquement d’images nécessitent d’abord un OCR.
Conservez les numéros des pages source, leur rotation et leurs limites visibles avec le texte extrait. Cela garde une référence utile lors de l’examen d’une plage sélectionnée.
Les caractères comme les esperluettes et les chevrons restent des données dans les éléments XML. Un texte ressemblant à du balisage ne peut pas devenir du contenu de page exécutable par cet export.
Les caractères que XML ne peut pas représenter directement utilisent un encodage de chaîne JSON explicitement signalé. Ce marqueur permet au programme destinataire de retrouver précisément les valeurs.
Créez le fichier XML sur votre appareil. La source n’est ni envoyée pour conversion ni réécrite.
Sélectionnez un PDF doté d’une couche de texte lisible.
Sélectionnez la capture d’écran pour l’agrandir.
Choisissez les pages nécessaires à l’extraction XML.
Sélectionnez la capture d’écran pour l’agrandir.
Téléchargez le XML et examinez ses éléments de page.
Sélectionnez la capture d’écran pour l’agrandir.
Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.
Un processus XML peut nécessiter des éléments explicites de page et de texte avant d’appliquer ses propres règles de transformation. Une équipe peut inspecter ces éléments, conserver les références aux pages source et créer une correspondance distincte pour les types de documents connus. Séparez cette correspondance de l’extraction : la proximité de deux éléments de texte ne définit pas à elle seule une relation métier.
Utilisez les éléments de page et de texte comme entrées d’un processus de traitement documentaire contrôlé.
Examinez si le texte reste disponible aux côtés du PDF original conservé.
Comparez des valeurs échantillonnées à leurs pages source avant d’adopter les règles de transformation.
| Réglage | Résultat attendu |
|---|---|
| Source | Un PDF de 25 MiB maximum avec au plus 500 pages source. |
| Plage de pages | Jusqu’à 200 pages sélectionnées. Une plage vide inclut toutes les pages seulement si cette limite est respectée. |
| Limites de texte | Jusqu’à 20 000 éléments par page, 100 000 par traitement et deux millions de caractères de texte. |
| Téléchargement | Un document XML de 64 MiB maximum. Aucune DTD ni aucun schéma externe n’est demandé. |
Pour un document de livraison, exportez une page et repérez un numéro de référence connu. Comparez sa transformation de texte et les éléments voisins à la page d’origine. Votre application peut ensuite appliquer une règle à ce type de document. Évitez de traiter tous les nombres voisins comme le même champ dans des présentations sans rapport.
| Situation | Points à vérifier |
|---|---|
| Le XML ne correspond pas au schéma d’un fournisseur | L’export utilise sa propre structure d’extraction. Créez une correspondance distincte avec le schéma attendu par votre système destinataire. |
| Un élément possède un attribut encoding | Si encoding vaut json, analysez son texte comme une chaîne JSON pour retrouver les caractères qui ne peuvent pas figurer directement en XML. |
| Des mots manquent ou leur ordre est inattendu | Vérifiez la présence de pages numérisées ou de positions de texte inhabituelles. Appliquez l’OCR au besoin et examinez les coordonnées. |
Non. Un PDF ne conserve généralement pas le modèle de données source. Cet export enregistre la couche de texte et la géométrie que le lecteur peut extraire.
Non. L’outil ne reconstitue pas la sémantique du PDF balisé, les titres ni la structure des tableaux. Ses éléments de page et de texte décrivent les résultats d’extraction.
L’outil XML en PDF peut imprimer le code XML, mais il ne peut pas recréer la présentation d’origine à partir de ce fichier d’extraction. Conservez le PDF original.