Extraire le texte existant
Lisez la couche de texte sélectionnable du document plutôt que de reconnaître les lettres dans les images numérisées.
Extrayez la couche de texte existante dans un fichier texte UTF-8.
Déposez les fichiers ici ou utilisez le bouton ci-dessous.
Jusqu’à 100 Mo au total · Les fichiers restent sur votre appareil
Visualisez le document ici. Pour le contenu ajouté, cet aperçu sert de guide de placement ; vérifiez le fichier enregistré.
Extrayez la couche de texte existante du PDF pour effectuer des recherches, copier le texte ou le modifier. Les lignes sont regroupées selon leur position sur la page. Cette fonction est particulièrement utile pour les rapports essentiellement textuels et les archives documentaires.
Le résultat contient du texte brut sans polices, images ni mise en page. L’ordre de lecture des pages à plusieurs colonnes peut différer de la disposition visuelle. Cette opération ne peut pas transcrire une page numérisée sans couche de texte.
Lisez la couche de texte sélectionnable du document plutôt que de reconnaître les lettres dans les images numérisées.
Limitez l’export à un chapitre, une lettre ou une annexe à l’aide du champ « Pages ».
Téléchargez un fichier texte brut qui s’ouvre dans les éditeurs de texte courants, sans mise en page de traitement de texte.
Les fragments de texte proches sont regroupés en lignes. L’ordre de lecture des contenus à plusieurs colonnes doit encore être vérifié par rapport à la page.
Le texte brut est utile lorsque les mots comptent davantage que la mise en page imprimée. Il permet de rechercher dans un dossier local, de copier le texte dans un éditeur ou de préparer une base propre pour la prise de notes. Il évite également d’introduire une mise en page riche en images dans une tâche textuelle. Une couche de texte ne correspond pas toujours exactement à ce que la page semble afficher : les ligatures, les erreurs OCR cachées et l’ordre des colonnes peuvent modifier l’export. Vérifiez des paragraphes représentatifs ainsi que les noms ou nombres importants avant d’utiliser le résultat pour la suite du travail.
Exportez le texte d’un article autorisé pour recueillir des citations et constituer des notes de lecture. Vérifiez chaque citation par rapport à sa page source et notez séparément le numéro de page.
Transférez le texte d’une lettre type dans un éditeur de texte pour en préparer une version révisée. Vérifiez les formules d’appel, les dates et les retours à la ligne avant de le placer dans le modèle de l’organisation.
Récupérez le texte de spécifications pour créer une note de travail interrogeable. Comparez les unités, les symboles et les étapes numérotées avec le PDF, car des encodages de polices inhabituels peuvent modifier les caractères extraits.
Sélectionnez un PDF contenant une couche de texte sélectionnable existante.
Sélectionnez la capture d’écran pour l’agrandir.
Choisissez les pages et, si souhaité, le nom du téléchargement.
Sélectionnez la capture d’écran pour l’agrandir.
Téléchargez le fichier TXT et vérifiez son texte en le comparant au PDF.
Sélectionnez la capture d’écran pour l’agrandir.
Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.
| Réglage | À quoi s’attendre |
|---|---|
| Formats acceptés | |
| Lieu du traitement | Votre navigateur |
| Sélection des fichiers | Un fichier source |
| Taille des fichiers sources | 100 Mo au total ; les images et les pages décodées sont également soumises à des limites de pixels |
| Sélection des pages | Jusqu’à 200 pages sélectionnées par traitement. Un champ « Pages » vide signifie toutes les pages uniquement si le PDF contient 200 pages ou moins ; utilisez des plages séparées pour un document plus long. |
Si aucun texte ne peut être sélectionné parce que la page est une numérisation, ajoutez et vérifiez une couche de texte OCR avant d’utiliser l’extraction de texte.
Les fragments de texte peuvent être stockés dans le PDF dans un ordre différent de leurs positions visibles. Les encadrés, les notes de bas de page et les mises en page à deux colonnes expliquent souvent l’interruption d’une phrase exportée. La lettre visible peut aussi dépendre d’une correspondance de police qui ne fournit pas le même caractère à l’extraction. Comparez un paragraphe passant d’une colonne ou d’une page à l’autre, puis inspectez les symboles techniques et les ligatures comme « fi » avant de considérer le TXT comme une restitution fiable du texte source.
| Situation | Que faire |
|---|---|
| Le fichier texte est vide ou la conversion est refusée | Les pages sélectionnées peuvent ne pas avoir de couche de texte. Utilisez d’abord l’OCR lorsque cela est possible. |
| Certaines lettres sont incorrectes | L’encodage du texte ou la couche OCR du PDF peut être défectueux. Comparez les noms, les nombres et les symboles avec la page visible. |
| Vous avez besoin d’un document mis en forme et modifiable | Utilisez PDF en Word pour obtenir une base DOCX ; la mise en page exacte doit encore être vérifiée. |
Imaginez deux colonnes contenant A1, A2 à gauche et B1, B2 à droite. Le regroupement par position peut produire A1 B1 puis A2 B2, en mélangeant les colonnes. Lisez chaque colonne dans le PDF avant de réorganiser les lignes extraites ; un fichier texte d’apparence propre peut relier des phrases sans rapport.
Exécutez d’abord l’OCR pour ajouter du texte reconnu. La sélection d’un fichier source composé uniquement d’images affiche un message clair indiquant l’absence de texte.
Le regroupement des lignes selon leur position fournit une approximation de leur ordre. Les sauts de paragraphe et les colonnes complexes nécessitent une relecture éditoriale.
Le texte des pages sélectionnées est assemblé avec des lignes vides. Conservez la plage de pages physiques dans vos notes si vous avez besoin de citations renvoyant précisément au PDF.
Poursuivez avec Reconnaissance de texte (OCR), Lecteur PDF. Pour un résultat dans une autre langue, consultez la méthode de traduction d’un PDF; l’extraction de texte ne traduit pas elle-même.