Sélection des pages
Exportez une plage précise tout en conservant les numéros de page d’origine. Un petit échantillon est ainsi plus facile à examiner avant de traiter un document long.
Exportez le texte sélectionnable, la géométrie des pages et les positions du texte en JSON.
Déposez les fichiers ici ou utilisez le bouton ci-dessous.
Jusqu’à 25 Mo au total · Les fichiers restent sur votre appareil
Visualisez le document ici. Pour le contenu ajouté, cet aperçu sert de guide de placement ; vérifiez le fichier enregistré.
Transformez la couche de texte d’un PDF en fichier JSON pour l’examiner ou la traiter ensuite. L’export enregistre les pages sélectionnées, leurs dimensions et les éléments de texte renvoyés par le lecteur PDF, avec leurs positions et leurs transformations.
Un PDF stocke des instructions d’affichage de page. Cet outil ne déduit pas les champs de facture, ne reconstitue pas les tableaux et n’identifie pas les niveaux des titres d’origine. Les pages numérisées nécessitent un OCR avant que leurs mots puissent apparaître dans l’export.
Exportez une plage précise tout en conservant les numéros de page d’origine. Un petit échantillon est ainsi plus facile à examiner avant de traiter un document long.
Conservez les éléments de texte avec la géométrie des pages et les informations de positionnement. Utilisez le PDF original pour interpréter les coordonnées et vérifier les relations visuelles entre les éléments.
Téléchargez un JSON valide pour votre propre analyseur ou votre processus de vérification. Le texte exporté est échappé comme donnée ; l’outil n’exécute pas le contenu du document.
Lisez le PDF sélectionné dans votre navigateur. Votre document n’est pas envoyé à un serveur de conversion et le fichier original n’est pas modifié.
Choisissez un PDF contenant du texte sélectionnable.
Sélectionnez la capture d’écran pour l’agrandir.
Définissez la plage de pages et vérifiez les limites d’extraction.
Sélectionnez la capture d’écran pour l’agrandir.
Enregistrez le JSON et comparez-le à la page source.
Sélectionnez la capture d’écran pour l’agrandir.
Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.
JSON est utile lorsqu’un processus documentaire a besoin à la fois du texte et de sa position. Un développeur peut examiner la qualité de l’extraction, repérer des libellés répétés ou préparer une mise en correspondance distincte. Rendez cette correspondance explicite : un montant voisin n’est pas automatiquement le total d’une facture, et l’ordre d’extraction ne correspond pas forcément à l’ordre de lecture humain.
Examinez la couche de texte avant de créer un analyseur et conservez les références de page pour le débogage.
Comparez des valeurs échantillonnées à la page source avant d’accepter une règle d’extraction.
Explorez la représentation du texte visible dans un document à mise en page fixe.
| Réglage | Résultat attendu |
|---|---|
| Entrée | Un PDF de 25 MiB maximum, avec au plus 500 pages source. |
| Sélection | Jusqu’à 200 pages sélectionnées ; au plus 20 000 éléments de texte par page, 100 000 par traitement et deux millions de caractères de texte. |
| Sortie | JSON contenant le texte extrait et la géométrie ; 64 MiB maximum. |
| Pages numérisées | Sans OCR automatique, export d’images ni reconnaissance des champs du document. |
Pour un relevé à deux colonnes, exportez d’abord une page. Repérez un libellé connu et comparez sa position à la valeur imprimée. Si les éléments des deux colonnes sont entremêlés, regroupez-les par coordonnées dans votre propre code au lieu de considérer le tableau de données comme un tableau déjà reconstitué.
| Situation | Points à vérifier |
|---|---|
| Aucun texte sélectionnable n’est trouvé | Effectuez un OCR sur les pages numérisées, puis exportez la couche de texte du PDF obtenu. |
| Le texte apparaît dans un ordre inattendu | Comparez la page et les positions du texte ; l’ordre d’extraction ne détermine pas l’ordre de lecture. |
| Une sélection volumineuse est refusée | Choisissez moins de pages. Les pages denses peuvent atteindre la limite d’éléments de texte avant la limite de pages. |
Non. Le résultat contient des éléments de texte et leur géométrie. Les noms de champs, les relations et la validation métier exigent une mise en correspondance distincte.
Les images ne sont pas exportées. Le texte d’un tableau peut être extrait, mais les relations entre lignes et colonnes ne sont pas reconstituées.
L’export est un format d’inspection, pas une représentation complète du PDF. Conservez le PDF original pour son apparence, ses graphiques, ses polices et ses fonctions interactives.