PDF en texte

Extrayez la couche de texte existante dans un fichier texte UTF-8.

Sélectionner des fichiers PDF

Déposez les fichiers ici ou utilisez le bouton ci-dessous.

Jusqu’à 100 Mo au total · Les fichiers restent sur votre appareil

Sommaire11 sections

Que peut-on extraire d’un PDF en texte brut ?

Extrayez la couche de texte existante du PDF pour effectuer des recherches, copier le texte ou le modifier. Les lignes sont regroupées selon leur position sur la page. Cette fonction est particulièrement utile pour les rapports essentiellement textuels et les archives documentaires.

Le résultat contient du texte brut sans polices, images ni mise en page. L’ordre de lecture des pages à plusieurs colonnes peut différer de la disposition visuelle. Cette opération ne peut pas transcrire une page numérisée sans couche de texte.

Fonctionnalités de PDF en texte

Extraire le texte existant

Lisez la couche de texte sélectionnable du document plutôt que de reconnaître les lettres dans les images numérisées.

Choisir les pages pertinentes

Limitez l’export à un chapitre, une lettre ou une annexe à l’aide du champ « Pages ».

Résultat TXT portable

Téléchargez un fichier texte brut qui s’ouvre dans les éditeurs de texte courants, sans mise en page de traitement de texte.

Regroupement des lignes selon leur position

Les fragments de texte proches sont regroupés en lignes. L’ordre de lecture des contenus à plusieurs colonnes doit encore être vérifié par rapport à la page.

Pourquoi convertir le texte d’un PDF en fichier texte ?

Le texte brut est utile lorsque les mots comptent davantage que la mise en page imprimée. Il permet de rechercher dans un dossier local, de copier le texte dans un éditeur ou de préparer une base propre pour la prise de notes. Il évite également d’introduire une mise en page riche en images dans une tâche textuelle. Une couche de texte ne correspond pas toujours exactement à ce que la page semble afficher : les ligatures, les erreurs OCR cachées et l’ordre des colonnes peuvent modifier l’export. Vérifiez des paragraphes représentatifs ainsi que les noms ou nombres importants avant d’utiliser le résultat pour la suite du travail.

Qui utilise le texte extrait des PDF ?

Chercheurs universitaires

Exportez le texte d’un article autorisé pour recueillir des citations et constituer des notes de lecture. Vérifiez chaque citation par rapport à sa page source et notez séparément le numéro de page.

Agents administratifs

Transférez le texte d’une lettre type dans un éditeur de texte pour en préparer une version révisée. Vérifiez les formules d’appel, les dates et les retours à la ligne avant de le placer dans le modèle de l’organisation.

Rédacteurs techniques

Récupérez le texte de spécifications pour créer une note de travail interrogeable. Comparez les unités, les symboles et les étapes numérotées avec le PDF, car des encodages de polices inhabituels peuvent modifier les caractères extraits.

Comment extraire le texte d’un PDF ?

  1. Sélectionnez un PDF avec du texte sélectionnable. S’il s’agit d’une numérisation composée uniquement d’images, créez d’abord une couche de texte par OCR.
  2. Saisissez les pages à extraire ou laissez « Pages » vide pour le document complet. Ajoutez un nom de fichier à télécharger si cela vous est utile.
  3. Lancez l’extraction et téléchargez le fichier TXT. Ouvrez-le dans un éditeur de texte.
  4. Comparez l’ordre des paragraphes, la ponctuation, les noms et les nombres importants avec le PDF d’origine avant de modifier ou de citer le texte.

Choisir le fichier source

Sélectionnez un PDF contenant une couche de texte sélectionnable existante.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en texte, étape 1 : Sélectionnez un PDF contenant une couche de texte sélectionnable existante.

Vérifier les réglages de l’outil

Choisissez les pages et, si souhaité, le nom du téléchargement.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en texte, étape 2 : Choisissez les pages et, si souhaité, le nom du téléchargement.

Télécharger et vérifier le résultat

Téléchargez le fichier TXT et vérifiez son texte en le comparant au PDF.

Sélectionnez la capture d’écran pour l’agrandir.
PDF en texte, étape 3 : Téléchargez le fichier TXT et vérifiez son texte en le comparant au PDF.

Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.

Réglages et vérification du résultat

RéglageÀ quoi s’attendre
Formats acceptésPDF
Lieu du traitementVotre navigateur
Sélection des fichiersUn fichier source
Taille des fichiers sources100 Mo au total ; les images et les pages décodées sont également soumises à des limites de pixels
Sélection des pagesJusqu’à 200 pages sélectionnées par traitement. Un champ « Pages » vide signifie toutes les pages uniquement si le PDF contient 200 pages ou moins ; utilisez des plages séparées pour un document plus long.

Si aucun texte ne peut être sélectionné parce que la page est une numérisation, ajoutez et vérifiez une couche de texte OCR avant d’utiliser l’extraction de texte.

Vérifier l’ordre de lecture et les caractères encodés

Les fragments de texte peuvent être stockés dans le PDF dans un ordre différent de leurs positions visibles. Les encadrés, les notes de bas de page et les mises en page à deux colonnes expliquent souvent l’interruption d’une phrase exportée. La lettre visible peut aussi dépendre d’une correspondance de police qui ne fournit pas le même caractère à l’extraction. Comparez un paragraphe passant d’une colonne ou d’une page à l’autre, puis inspectez les symboles techniques et les ligatures comme « fi » avant de considérer le TXT comme une restitution fiable du texte source.

Résoudre les problèmes de conversion de PDF en texte

SituationQue faire
Le fichier texte est vide ou la conversion est refuséeLes pages sélectionnées peuvent ne pas avoir de couche de texte. Utilisez d’abord l’OCR lorsque cela est possible.
Certaines lettres sont incorrectesL’encodage du texte ou la couche OCR du PDF peut être défectueux. Comparez les noms, les nombres et les symboles avec la page visible.
Vous avez besoin d’un document mis en forme et modifiableUtilisez PDF en Word pour obtenir une base DOCX ; la mise en page exacte doit encore être vérifiée.

Un exemple pratique et les dernières vérifications

Imaginez deux colonnes contenant A1, A2 à gauche et B1, B2 à droite. Le regroupement par position peut produire A1 B1 puis A2 B2, en mélangeant les colonnes. Lisez chaque colonne dans le PDF avant de réorganiser les lignes extraites ; un fichier texte d’apparence propre peut relier des phrases sans rapport.

Questions fréquentes

Puis-je extraire le texte d’un PDF numérisé ?

Exécutez d’abord l’OCR pour ajouter du texte reconnu. La sélection d’un fichier source composé uniquement d’images affiche un message clair indiquant l’absence de texte.

L’outil conserve-t-il les paragraphes ?

Le regroupement des lignes selon leur position fournit une approximation de leur ordre. Les sauts de paragraphe et les colonnes complexes nécessitent une relecture éditoriale.

Comment les pages sont-elles séparées dans le fichier texte téléchargé ?

Le texte des pages sélectionnées est assemblé avec des lignes vides. Conservez la plage de pages physiques dans vos notes si vous avez besoin de citations renvoyant précisément au PDF.

Outils et guides associés

Poursuivez avec Reconnaissance de texte (OCR), Lecteur PDF. Pour un résultat dans une autre langue, consultez la méthode de traduction d’un PDF; l’extraction de texte ne traduit pas elle-même.