PDF en JSON

Exportez le texte sélectionnable, la géométrie des pages et les positions du texte en JSON.

Sélectionner des fichiers PDF

Déposez les fichiers ici ou utilisez le bouton ci-dessous.

Jusqu’à 25 Mo au total · Les fichiers restent sur votre appareil

Sommaire10 sections

Que peut-on extraire d’un PDF en JSON ?

Transformez la couche de texte d’un PDF en fichier JSON pour l’examiner ou la traiter ensuite. L’export enregistre les pages sélectionnées, leurs dimensions et les éléments de texte renvoyés par le lecteur PDF, avec leurs positions et leurs transformations.

Un PDF stocke des instructions d’affichage de page. Cet outil ne déduit pas les champs de facture, ne reconstitue pas les tableaux et n’identifie pas les niveaux des titres d’origine. Les pages numérisées nécessitent un OCR avant que leurs mots puissent apparaître dans l’export.

Fonctions de PDF en JSON

Sélection des pages

Exportez une plage précise tout en conservant les numéros de page d’origine. Un petit échantillon est ainsi plus facile à examiner avant de traiter un document long.

Texte avec coordonnées

Conservez les éléments de texte avec la géométrie des pages et les informations de positionnement. Utilisez le PDF original pour interpréter les coordonnées et vérifier les relations visuelles entre les éléments.

Résultat lisible par machine

Téléchargez un JSON valide pour votre propre analyseur ou votre processus de vérification. Le texte exporté est échappé comme donnée ; l’outil n’exécute pas le contenu du document.

Traitement local

Lisez le PDF sélectionné dans votre navigateur. Votre document n’est pas envoyé à un serveur de conversion et le fichier original n’est pas modifié.

Comment convertir le texte d’un PDF en JSON ?

  1. Choisissez un PDF non chiffré dont le texte peut être sélectionné dans un lecteur.
  2. Saisissez des numéros comme 1, 3-5, ou laissez Pages vide pour inclure toutes les pages autorisées.
  3. Lancez la conversion et téléchargez le fichier JSON.
  4. Ouvrez-le dans un visualiseur ou un éditeur JSON et comparez une phrase connue à la page PDF correspondante.
  5. Vérifiez les coordonnées, l’ordre de lecture et les éventuelles pages vides avant d’utiliser les données dans une autre application.

Sélectionnez le PDF

Choisissez un PDF contenant du texte sélectionnable.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en JSON : sélection d’un PDF d’exemple doté d’une couche de texte.

Choisissez les pages

Définissez la plage de pages et vérifiez les limites d’extraction.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en JSON : sélection des pages et réglages d’extraction.

Téléchargez le JSON

Enregistrez le JSON et comparez-le à la page source.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en JSON : téléchargement de l’export de texte structuré terminé.

Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.

Pourquoi exporter le texte d’un PDF en JSON ?

JSON est utile lorsqu’un processus documentaire a besoin à la fois du texte et de sa position. Un développeur peut examiner la qualité de l’extraction, repérer des libellés répétés ou préparer une mise en correspondance distincte. Rendez cette correspondance explicite : un montant voisin n’est pas automatiquement le total d’une facture, et l’ordre d’extraction ne correspond pas forcément à l’ordre de lecture humain.

Qui peut utiliser cet export ?

Développeurs de solutions documentaires

Examinez la couche de texte avant de créer un analyseur et conservez les références de page pour le débogage.

Équipes de vérification des données

Comparez des valeurs échantillonnées à la page source avant d’accepter une règle d’extraction.

Étudiants et chercheurs

Explorez la représentation du texte visible dans un document à mise en page fixe.

Réglages et vérifications du résultat

RéglageRésultat attendu
EntréeUn PDF de 25 MiB maximum, avec au plus 500 pages source.
SélectionJusqu’à 200 pages sélectionnées ; au plus 20 000 éléments de texte par page, 100 000 par traitement et deux millions de caractères de texte.
SortieJSON contenant le texte extrait et la géométrie ; 64 MiB maximum.
Pages numériséesSans OCR automatique, export d’images ni reconnaissance des champs du document.

Vérifiez un petit échantillon avant de créer un analyseur

Pour un relevé à deux colonnes, exportez d’abord une page. Repérez un libellé connu et comparez sa position à la valeur imprimée. Si les éléments des deux colonnes sont entremêlés, regroupez-les par coordonnées dans votre propre code au lieu de considérer le tableau de données comme un tableau déjà reconstitué.

Résoudre les problèmes de PDF en JSON

SituationPoints à vérifier
Aucun texte sélectionnable n’est trouvéEffectuez un OCR sur les pages numérisées, puis exportez la couche de texte du PDF obtenu.
Le texte apparaît dans un ordre inattenduComparez la page et les positions du texte ; l’ordre d’extraction ne détermine pas l’ordre de lecture.
Une sélection volumineuse est refuséeChoisissez moins de pages. Les pages denses peuvent atteindre la limite d’éléments de texte avant la limite de pages.

Questions fréquentes

PDF en JSON reconnaît-il les champs de facture ?

Non. Le résultat contient des éléments de texte et leur géométrie. Les noms de champs, les relations et la validation métier exigent une mise en correspondance distincte.

Les images et les tableaux sont-ils inclus ?

Les images ne sont pas exportées. Le texte d’un tableau peut être extrait, mais les relations entre lignes et colonnes ne sont pas reconstituées.

Puis-je recréer le PDF original à partir de ce JSON ?

L’export est un format d’inspection, pas une représentation complète du PDF. Conservez le PDF original pour son apparence, ses graphiques, ses polices et ses fonctions interactives.

Outils associés

JSON en PDF, PDF en XML, OCR PDF.