Reconnaissance de texte (OCR)

Rendez les numérisations recherchables en conservant l’apparence des pages.

Sélectionner des fichiers PDF

Déposez les fichiers ici ou utilisez le bouton ci-dessous.

Jusqu’à 100 Mo au total · Les fichiers restent sur votre appareil

Sommaire12 sections

Quand un PDF a-t-il besoin d’OCR ?

Ajoutez une couche de texte recherchable à un PDF numérisé avec Tesseract exécuté dans votre navigateur. Choisissez la langue du document source ; le français est sélectionné par défaut. Les lecteurs compatibles pourront rechercher et sélectionner les mots reconnus, tandis que la page numérisée conservera son apparence d’origine.

Par défaut, l’opération conserve les pages qui contiennent déjà du texte. Vous pouvez aussi reconnaître chaque page sélectionnée ; cela ajoute une nouvelle couche et peut dupliquer le texte existant. La précision de l’OCR dépend de la netteté, du contraste, de la langue et de l’alignement de la page. Les petits caractères, l’écriture manuscrite, les polices inhabituelles et les numérisations bruitées nécessitent une vérification attentive plutôt qu’une confiance automatique.

Fonctionnalités de reconnaissance de texte PDF (OCR)

PDF avec recherche ou TXT

Téléchargez le texte reconnu en texte brut ou ajoutez une couche de texte dans un PDF qui conserve l’apparence de la numérisation.

Jusqu’à 20 pages sélectionnées

Le téléchargement contient uniquement les pages sélectionnées. Choisissez jusqu’à 20 pages ; laissez « Pages » vide pour inclure le document entier uniquement s’il compte 20 pages ou moins.

Réglages de reconnaissance

Choisissez la langue source, 200 ou 300 DPI, une rotation pour la reconnaissance et une disposition automatique, en bloc unique ou en texte épars. Les langues prises en charge figurent dans la FAQ ci-dessous.

Conserver le texte existant par défaut

Les pages qui contiennent déjà du texte peuvent être conservées. Forcez la reconnaissance uniquement après avoir pris en compte le risque de couches de texte dupliquées.

Pourquoi ajouter une couche de texte recherchable à une numérisation ?

Une numérisation stocke la page sous forme d’image ; une recherche textuelle ordinaire ne peut donc pas retrouver les mots qui y sont imprimés. L’OCR dans la langue sélectionnée peut rendre une numérisation de texte dactylographié interrogeable et fournir du texte pour le copier-coller ou une extraction ultérieure. Il est particulièrement utile pour les archives dans lesquelles retrouver un nom ou une expression connue compte davantage que refaire la mise en page. La couche reconnue peut contenir des erreurs même lorsque la numérisation semble nette. Testez la recherche et la sélection, puis comparez les noms, les références et les nombres avec l’image de page avant d’utiliser le texte extrait.

Qui utilise l’OCR sur des PDF numérisés ?

Personnel de bibliothèques et d’archives

Rendez un court document dactylographié recherchable par titre, nom ou numéro de référence. Conservez la numérisation d’origine et testez ces termes dans la copie téléchargée, y compris les caractères faciles à confondre.

Étudiants disposant de supports numérisés

Rendez les notes de cours dactylographiées interrogeables avant de constituer des notes d’étude. Les annotations manuscrites peuvent rester peu fiables ; vérifiez donc les passages cités par rapport à la numérisation.

Gestionnaires du personnel pour les tâches courantes

Extrayez le texte d’une note numérisée approuvée pour un index interne. Comparez attentivement les dates, les noms du personnel et les numéros de référence, car un seul caractère reconnu peut modifier un identifiant.

Comment rendre un PDF numérisé recherchable ?

  1. Choisissez une numérisation non chiffrée et sélectionnez au maximum 20 pages. Le PDF téléchargé contient uniquement cette sélection. Commencez par un court échantillon si vous n’avez pas encore utilisé ce type de numérisation.
  2. Sélectionnez la langue source dans « Langue du texte ». Choisissez « PDF avec recherche » ou « Extraire uniquement le texte », réglez la résolution de reconnaissance, puis sélectionnez une rotation ou une disposition de page si la numérisation le nécessite.
  3. Conservez le texte existant par défaut ou choisissez délibérément « Reconnaître chaque page sélectionnée ». Lancez l’OCR et attendez la fin de la reconnaissance.
  4. Téléchargez le résultat. Recherchez une expression connue, copiez une ligne et comparez l’orthographe et les nombres avec la numérisation d’origine.

Choisir le fichier source

Choisissez une numérisation dans une langue prise en charge et sélectionnez jusqu’à 20 pages.

Sélectionnez la capture d’écran pour l’agrandir.
Reconnaissance de texte (OCR), étape 1 : Choisissez une numérisation dans une langue prise en charge et sélectionnez jusqu’à 20 pages.

Vérifier les réglages de l’outil

Choisissez la langue source, le résultat OCR, la résolution, la disposition et l’orientation de reconnaissance.

Sélectionnez la capture d’écran pour l’agrandir.
Reconnaissance de texte (OCR), étape 2 : Choisissez la langue source, le résultat OCR, la résolution, la disposition et l’orientation de reconnaissance.

Télécharger et vérifier le résultat

Téléchargez le résultat et comparez le texte reconnu à la numérisation d’origine.

Sélectionnez la capture d’écran pour l’agrandir.
Reconnaissance de texte (OCR), étape 3 : Téléchargez le résultat et comparez le texte reconnu à la numérisation d’origine.

Les captures d’écran présentent cette boîte à outils avec des fichiers d’exemple sans données sensibles. Le nom de votre fichier, le nombre de pages et les réglages peuvent différer.

Une liste de vérification en image rendue recherchable

La page source est une image sans texte extractible. L’OCR ajoute une couche de texte tout en conservant l’apparence visible de la page. Les deux images ont donc le même aspect ; le résultat téléchargeable contient également les mots reconnus.

Avant : page composée uniquement d’une image

L’extraction de texte de la source a renvoyé zéro caractère.

Véritable liste de vérification sous forme d’image avant OCR, sans couche de texte sélectionnable.

Après : même page, texte recherchable

Le résultat contient les six lignes de l’exemple. Ses pixels rendus correspondent à la source à la taille d’image testée de 1 300 pixels.

Véritable PDF de résultat avec recherche, montrant la même liste de vérification et une nouvelle couche de texte.
Texte source
0 caractère
Texte du résultat
235 caractères
Vérification de la reconnaissance
6 lignes d’exemple sur 6 (espaces et apostrophes normalisés)
Lire le texte extrait de ce résultat
LISTE POUR L'ATELIER 
Confirmez la réservation de la salle. 
Imprimez quarante copies des documents. 
Vérifiez le projecteur avant 09:00. 
Conservez la liste définitive des participants. 
Ceci est un exemple sans données personnelles.

Réglages utilisés : Page 1 ; PDF avec recherche ; français ; reconnaissance à 200 PPP ; bloc de texte unique ; orientation d’origine.

Cet exemple français net et en gros caractères n’est pas un étalon de précision pour les petits caractères, l’écriture manuscrite, les numérisations inclinées ou les autres langues. Relisez les noms, les montants et les dates dans votre propre résultat.

Vérifié le . Exemples sans données sensibles traités dans l’édition française du thème 3.10.0 avec un navigateur Chromium local. Ces exemples ne constituent pas un test de performance d’un hébergement en production.

Réglages et vérification du résultat

RéglageÀ quoi s’attendre
Formats acceptésPDF
Lieu du traitementVotre navigateur, sur votre appareil
Sélection des fichiersUn fichier source
Taille des fichiers sourcesJusqu’à 100 Mo, sous réserve de la mémoire de l’appareil et des limites des pages décodées
Lot de reconnaissanceJusqu’à 20 pages sélectionnées ; seules ces pages figurent dans le PDF avec recherche téléchargé.

L’outil ajoute une couche de texte ; il ne reconstitue pas les tableaux dans un classeur modifiable et ne corrige pas les faits contenus dans le document. L’OCR ne remplace pas la vérification des noms, des numéros de compte et des autres textes exigeant une grande précision.

Vérifier l’orientation de reconnaissance sans modifier la numérisation

Le réglage de rotation fait pivoter la numérisation rendue fournie à la reconnaissance ; le PDF avec recherche conserve l’apparence visible de la page source. Il ne remplace pas Faire pivoter un PDF lorsque vous souhaitez que les lecteurs voient la page à l’endroit. Si une couche de texte existante contient des erreurs, forcer la reconnaissance peut ajouter une autre couche et produire des résultats de recherche en double. Un OCR en texte brut peut constituer une extraction vérifiée utile dans cette situation. Comparez à l’image les caractères faciles à confondre, comme 0/O, 1/l et les points décimaux.

Résoudre les problèmes de reconnaissance de texte PDF

SituationQue faire
Un nom ou un nombre est incorrectComparez le texte reconnu avec l’image. Corrigez-le dans un éditeur adapté utilisé ensuite avant de le réemployer.
Une mauvaise couche OCR existante ne s’est pas amélioréeChoisissez « Reconnaître chaque page sélectionnée » pour ajouter une nouvelle couche. Le texte existant est conservé ; une couche déjà présente peut donc produire des résultats de recherche en double. Exportez du texte brut si vous avez besoin d’une extraction propre.
Un long dossier est refuséDivisez-le en groupes de 20 pages ou moins, appliquez l’OCR à chaque groupe et vérifiez-les avant de les fusionner.

Un exemple pratique et les dernières vérifications

Pour une fiche d’inspection dactylographiée, recherchez un identifiant d’équipement connu dans le PDF avec recherche, puis copiez cet identifiant et une mesure dans un éditeur de texte. Comparez-les tous deux avec la numérisation et confirmez que la sélection met en évidence la ligne voulue. Une recherche de mot réussie ne suffit pas à établir un ordre de lecture correct ou une extraction numérique fiable.

Questions fréquentes

L’OCR transforme-t-il la page en contenu Word modifiable ?

Le résultat reste un PDF avec une couche de texte ajoutée. Utilisez ensuite PDF en Word si vous avez besoin d’un document textuel dont la mise en page peut se réorganiser.

Quelles langues sont disponibles ?

Cette version inclut les modèles de reconnaissance du français, de l’anglais, de l’espagnol, du portugais, de l’allemand, de l’indonésien, du russe, de l’italien, du turc, de l’arabe, du chinois simplifié, du japonais, du coréen, du polonais et de l’hindi. Le français est la langue par défaut ; sélectionnez celle qui correspond à la source. L’OCR reconnaît les caractères, mais ne traduit pas le document. Les autres langues nécessitent une méthode OCR configurée séparément.

Pourquoi une page a-t-elle été ignorée ?

Le réglage par défaut conserve les pages disposant déjà d’une couche de texte. Sélectionnez « Reconnaître chaque page sélectionnée » pour lancer également la reconnaissance sur celles-ci.

Le résultat comprend-il des pages que je n’ai pas sélectionnées ?

Non. Le PDF avec recherche contient uniquement les pages sélectionnées. Pour conserver un long document complet, reconnaissez des lots de 20 pages maximum, puis combinez les résultats vérifiés dans leur ordre d’origine.

La rotation de reconnaissance fera-t-elle pivoter la page PDF visible ?

Non. Elle fait pivoter l’image fournie à la reconnaissance tout en conservant l’apparence visible de la page source dans le PDF. Utilisez d’abord Faire pivoter un PDF lorsque la page enregistrée elle-même doit apparaître à l’endroit.

Cet outil peut-il lire l’écriture manuscrite de manière fiable ou reconstituer les tableaux ?

L’outil reconnaît du texte dans la langue choisie ; il ne promet pas une reconnaissance fiable de l’écriture manuscrite et ne reconstruit pas les cellules d’un tableau. Utilisez une numérisation nette et droite de texte dactylographié, puis vérifiez les mots avant de les reprendre dans Word ou un tableur.

Outils et guides associés

Poursuivez avec PDF en Word, PDF en texte, Numérisation en PDF. Pour les exigences de stockage à long terme, consultez la PDF en PDF/A; un PDF avec recherche n’est pas automatiquement un PDF/A.