PDF en YAML

Exportez les éléments de texte PDF et leurs positions sur les pages en données YAML.

Sélectionner des fichiers PDF

Déposez les fichiers ici ou utilisez le bouton ci-dessous.

Jusqu’à 25 Mo au total · Les fichiers restent sur votre appareil

Sommaire10 sections

Que peut exporter PDF en YAML ?

Créez un fichier YAML contenant les éléments de texte extraits de pages PDF sélectionnées. Le résultat comprend les références aux pages source, la géométrie des pages et les transformations de position du texte, pour inspection dans un éditeur ou un processus distinct.

L’export n’interprète pas le document comme une configuration d’application. Il ne déduit pas les niveaux des titres, n’extrait pas les images, ne reconnaît pas les champs de facture et ne reconstitue pas un tableau d’après son apparence. Le texte suit l’ordre d’extraction du lecteur PDF, qui peut différer de l’ordre de lecture.

Fonctions de PDF en YAML

Scalaires textuels entre guillemets

Conservez les mots comme yes, les dates, la ponctuation et les phrases avec deux-points comme valeurs de chaîne. Le texte extrait ne devient pas une instruction YAML ou une balise d’objet personnalisé.

Références aux pages d’origine

Les pages sélectionnées conservent leurs numéros source. Les relecteurs peuvent revenir à la page PDF correspondante sans compter les positions dans le tableau de sortie.

Géométrie du texte

Stockez les transformations et la direction du texte ainsi que les dimensions des pages avec les mots. Un traitement ultérieur peut examiner leur placement sans supposer qu’un tableau est déjà reconstitué.

Portée d’extraction explicite

Le résultat indique qu’aucune reconstitution sémantique ni aucun OCR n’a été réalisé. Cela aide un autre programme à le traiter comme des données extraites.

Comment convertir le texte d’un PDF en YAML ?

  1. Choisissez un PDF non chiffré avec du texte sélectionnable.
  2. Saisissez une petite plage ou laissez Pages vide lorsque le document entier respecte la limite de sélection.
  3. Lancez la conversion et enregistrez le fichier .yaml.
  4. Ouvrez la sortie dans un éditeur compatible YAML et vérifiez les entrées des pages et des éléments.
  5. Comparez les chaînes importantes et leurs positions au PDF original avant de les utiliser dans un autre processus.

Sélectionnez le PDF

Choisissez un PDF contenant le texte à examiner.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en YAML : sélection d’un PDF d’exemple.

Choisissez la plage d’extraction

Commencez par un petit ensemble de pages source.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en YAML : sélection des pages pour un export structuré.

Téléchargez le YAML

Enregistrez le résultat et examinez ses valeurs textuelles entre guillemets.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en YAML : téléchargement des données structurées terminé.

Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.

Pourquoi exporter le texte d’un PDF en YAML ?

YAML peut être pratique pour les vérifications textuelles lorsqu’une équipe souhaite des informations de page structurées sans visualiseur distinct. Utilisez l’export comme données documentaires et appliquez votre propre validation avant de l’importer. Un relevé PDF ne doit jamais devenir une configuration de confiance simplement parce que ses mots sont stockés dans un fichier YAML.

Qui peut utiliser une extraction YAML ?

Développeurs d’automatisation

Examinez le texte et les références de page avant de concevoir des règles d’extraction pour une présentation documentaire connue.

Équipes de recherche

Conservez un relevé intermédiaire lisible pendant la vérification de citations sélectionnées et de leur emplacement dans les pages.

Relecteurs techniques

Comparez les modifications des données documentaires extraites avec des outils adaptés aux fichiers texte structurés.

Réglages et vérifications du résultat

RéglageRésultat attendu
Fichier d’entréeUn PDF de 25 MiB maximum et de 500 pages source au plus.
Pages sélectionnéesJusqu’à 200 pages dans l’ordre saisi ; les références répétées n’apparaissent qu’une fois.
Limites d’extraction20 000 éléments par page, 100 000 par traitement et deux millions de caractères de texte.
Sortie YAMLYAML 1.2 déclaré, avec valeurs de chaîne entre guillemets ; téléchargement de 64 MiB maximum.

Conservez une valeur imprimée sous forme de texte

Un formulaire peut contenir le mot imprimé yes près d’un libellé et un nombre commençant par des zéros. Examinez ces chaînes extraites dans le YAML et comparez-les à la source. L’export conserve le texte comme valeurs entre guillemets, laissant votre application déterminer s’il s’agit d’un libellé, d’un identifiant, d’une date ou d’autre chose.

Résoudre les problèmes de PDF en YAML

SituationPoints à vérifier
Le texte contient des séquences UnicodeUn analyseur YAML peut retrouver les caractères d’origine à partir des séquences entre guillemets. Cela empêche aussi les caractères de contrôle de perturber la structure du fichier.
La sortie n’est pas une configuration prête à importerC’est un relevé d’extraction. Associez et validez séparément les champs nécessaires à votre application.
La sélection est trop denseRéduisez la plage de pages. Une page dense peut atteindre la limite d’éléments de texte ou de caractères avant la limite de pages.

Questions fréquentes

Cet outil lit-il ou exécute-t-il une entrée YAML ?

Non. Il lit un PDF et crée une sortie YAML. Il ne charge pas de YAML envoyé, n’exécute pas de balises et n’applique pas de paramètres de configuration.

Reconnaît-il le texte des pages numérisées ?

Aucun OCR automatique n’est effectué. Appliquez d’abord un OCR à un PDF constitué d’images, puis examinez le texte reconnu avant de l’exporter.

Les éléments extraits sont-ils déjà dans l’ordre de lecture ?

Pas nécessairement. Les pages à plusieurs colonnes et les libellés positionnés peuvent donner un ordre d’extraction différent. Examinez leurs coordonnées et la page d’origine.

Outils associés

PDF en JSON, PDF en XML, OCR PDF.