Aller au contenu
File Acture

Comment rendre un PDF numérisé interrogeable sous Windows

Les Actions de texte de l'Outil Capture d'écran et Text Extractor de PowerToys savent copier le texte d'une page numérisée affichée à l'écran, mais ils ne l'enregistrent pas dans le PDF : une recherche dans Edge ne trouve donc toujours rien. OCR PDF de File Acture reconnaît le texte sur votre PC et l'intègre sous forme de calque invisible, ce qui vous donne une copie interrogeable identique au scan.

Mise à jour le 24 septembre 20266 min de lecture

Par l'équipe File Acture

Vous avez numérisé une pile de reçus ou un contrat signé, et voilà que Ctrl+F dans Edge ne trouve rien. C'est que le scanner a enregistré chaque page comme une image. L'OCR, pour reconnaissance optique de caractères, lit les lettres de cette image et les stocke comme du vrai texte : le fichier devient interrogeable sans changer d'apparence.

Pourquoi ne peut-on ni chercher ni copier le texte d'un PDF numérisé ?

Vous ne pouvez pas faire de recherche dans un PDF numérisé parce qu'il contient une photo de chaque page, et non les lettres elles-mêmes. Les scanners à plat, les applications de numérisation sur téléphone et les photocopieurs de bureau enregistrent en général les pages ainsi, sauf s'ils font de l'OCR pendant la numérisation.

Le résultat ressemble à un document mais se comporte comme un album photo. La recherche d'Edge ne trouve rien, vous ne pouvez pas sélectionner une ligne ni copier un numéro de compte dans un e-mail : vous finissez par le retaper.

Windows peut-il faire l'OCR d'un PDF tout seul ?

Windows sait lire du texte à l'écran, mais il ne peut pas ajouter de calque de texte à un PDF : il ne peut donc pas rendre un scan interrogeable. Microsoft Edge affiche le scan et vous laisse dessiner ou ajouter du texte par-dessus, mais il n'a aucune option pour enregistrer du texte reconnu dans le fichier.

Sous Windows 11, l'Outil Capture d'écran (Snipping Tool) sait lire le texte : appuyez sur la touche Windows + Maj + S, capturez une partie de la page, ouvrez la capture dans l'Outil Capture d'écran, cliquez sur Actions de texte et copiez le texte. PowerToys, une application gratuite de Microsoft à installer à part, ajoute Text Extractor, qui copie le texte de tout ce qui s'affiche à l'écran. Les deux dépannent bien pour récupérer un numéro de téléphone ou une adresse.

L'ennui, c'est que rien n'est écrit dans le fichier. La recherche d'Edge, les autres applications et la personne à qui vous envoyez le PDF ont toujours affaire à une image. Pour un document que vous fouillerez plus tard ou que vous confierez à quelqu'un, le texte doit être intégré au PDF lui-même.

Comment faire l'OCR d'un PDF sous Windows avec File Acture

OCR PDF de File Acture lance la reconnaissance de texte sur chaque page numérisée, sur votre PC, et intègre le résultat en calque de texte invisible par-dessus l'image d'origine. La page a exactement la même allure qu'avant, mais vous pouvez y chercher, sélectionner des lignes et les copier.

Choisissez la langue du document avant de commencer : dire au moteur de reconnaissance à quoi s'attendre donne de meilleurs résultats, surtout avec les accents et les autres alphabets.

Vous pouvez traiter plusieurs PDF en une fois. Chacun reçoit une copie interrogeable, enregistrée comme nouveau fichier dans le dossier de votre choix, et vos scans d'origine restent inchangés.

Comment vérifier que l'OCR a fonctionné ?

Ouvrez la copie interrogeable dans Edge et appuyez sur Ctrl+F : les mots visibles sur la page devraient se surligner à leur place. Vous pouvez aussi glisser sur une ligne pour la sélectionner, ou coller un paragraphe copié dans le Bloc-notes pour voir exactement ce qui a été reconnu.

Conseils pour de meilleurs résultats OCR sous Windows

L'OCR ne vaut que ce que vaut le scan : des pages droites et nettes donnent le meilleur texte.

  • Choisissez la langue. Indiquer la langue du document dit au moteur à quoi s'attendre, surtout avec les accents et les écritures non latines.
  • Numérisez à 300 ppp. Si vous maîtrisez le scanner, 300 ppp est un bon réglage pour du texte. Beaucoup plus bas, les petits caractères deviennent des formes floues difficiles à lire.
  • Redressez les pages d'abord. Remettez les pages couchées à l'endroit avec Faire pivoter les pages avant de lancer l'OCR.
  • Des photos de documents ? Réunissez-les dans un seul PDF avec Images en PDF, puis lancez l'OCR sur le résultat.
  • Un scan protégé par mot de passe ? Retirez d'abord le mot de passe avec Déverrouiller un PDF, lancez l'OCR sur la copie, puis protégez de nouveau la copie interrogeable avec Protéger un PDF.
  • Surveillez la taille du fichier. L'OCR ajoute du texte, il ne réduit pas les images. Si la copie est trop lourde à envoyer, passez-la dans Compresser un PDF : le calque de texte reste en place.

Est-il sûr de faire de l'OCR en ligne ?

Les services d'OCR en ligne ont besoin de votre document sur leurs serveurs, ce qui compte pour des relevés bancaires, des courriers médicaux et des copies de pièces d'identité. File Acture fait la reconnaissance de texte sur votre PC, les pages ne le quittent donc jamais ; la version gratuite n'a besoin d'une connexion Internet que pour compter ses utilisations.

La version gratuite comprend 3 utilisations sur chaque PC, avec jusqu'à 5 PDF par utilisation. Pour de longues archives de scans, consultez les tarifs.

Vous envoyez le résultat sur un portail ? Respectez sa limite de taille sans abîmer le scan.

Comment rendre un PDF numérisé interrogeable avec File Acture

  1. 1

    Ouvrez OCR PDF

    Choisissez OCR PDF et faites glisser vos PDF numérisés, ou cliquez sur Choisir des fichiers….

  2. 2

    Réglez la langue

    Choisissez la langue des documents, pour que le moteur de reconnaissance sache quelles lettres attendre.

  3. 3

    Lancez la reconnaissance

    Cliquez sur Reconnaître le texte. Chaque PDF reçoit une copie interrogeable, et l'original reste tel quel.

  4. 4

    Vérifiez le résultat

    Ouvrez la copie dans Edge, appuyez sur Ctrl+F et cherchez un mot que vous voyez sur la page.

Transformez vos PDF numérisés en PDF interrogeables, sur votre PC.

Gratuit à l'essai · fonctionne sur votre PC

Récupérer le texte d'un scan sous Windows
MéthodeEnregistre un PDF interrogeablePlusieurs fichiers à la foisReste sur votre PC
Outil Capture d'écran, Actions de texteNonNon, une capture à la foisOui
PowerToys Text ExtractorNonNon, une sélection à la foisOui
Sites OCR en ligneOuiVariableNon, le fichier est envoyé en ligne
File Acture, OCR PDFOuiOuiOui

Questions

Windows peut-il rendre un PDF interrogeable sans logiciel supplémentaire ?

Non. Edge sait afficher et annoter les PDF, et les Actions de texte de l'Outil Capture d'écran savent copier le texte d'une capture, mais rien d'intégré à Windows n'enregistre de calque de texte dans le fichier.

L'OCR change-t-il l'apparence de mon PDF ?

Non. Le texte reconnu est invisible et se place au-dessus de l'image de la page d'origine : les pages gardent la même allure pendant que la recherche et la copie fonctionnent.

Peut-on faire l'OCR de plusieurs PDF numérisés à la fois ?

Oui. Ajoutez-les tous à OCR PDF et cliquez sur Reconnaître le texte : chacun reçoit sa propre copie interrogeable. La version gratuite prend jusqu'à 5 PDF par utilisation.

Pourquoi du texte manque-t-il après l'OCR ?

Un texte flou, minuscule ou couché peut ne pas être reconnu. Remettez les pages à l'endroit, renumérisez à une résolution plus élevée si vous le pouvez, et vérifiez que la langue du document est bien sélectionnée.

Peut-on faire l'OCR d'un PDF protégé par mot de passe ?

Oui, si vous connaissez le mot de passe. Retirez-le avec Déverrouiller un PDF, lancez l'OCR sur la copie déverrouillée, puis remettez le mot de passe avec Protéger un PDF.

Mon scan est-il envoyé en ligne pour l'OCR ?

Non. File Acture reconnaît le texte sur votre PC et le fichier ne le quitte jamais. La version gratuite ne se connecte que pour compter ses utilisations.

Guides associés