Comment faire l'OCR d'un PDF scanné

Quand vous avez besoin de l'OCR, de quoi dépend la qualité de reconnaissance et quoi vérifier après le traitement d'un PDF scanné.

En bref : Pour faire l'OCR d'un PDF scanné, importez-le : l'outil reconnaît le texte imprimé et le rend sélectionnable et cherchable. La qualité dépend du scan (netteté, résolution, droiture) ; l'écriture manuscrite reste mal reconnue.

guide pas à pas

Étapes claires pour faire passer une tâche PDF de l’entrée à un résultat fiable.

Étapes suivantes

Table des matières

Vous recevez un PDF avec un contrat, un certificat ou un formulaire scanné. Vous tentez de sélectionner du texte et rien ne se passe : le curseur se comporte comme si la page était une image. Et c'est exactement ce qu'elle est, une image scannée sans couche de texte en dessous. L'OCR (reconnaissance optique de caractères) ajoute cette couche et transforme l'image en un document où le texte se sélectionne, se copie et se recherche.

Quand vous avez besoin de l'OCR

L'OCR est utile quand vous avez un PDF scanné et voulez copier un passage sans le retaper, chercher un mot avec Ctrl+F, reprendre le contenu dans un autre outil sans le ressaisir ou rendre un document archivé repérable par mot-clé. Si le PDF a déjà une couche de texte — vous pouvez donc sélectionner des mots — l'OCR est inutile.

De quoi dépend la qualité

La qualité du résultat dépend presque entièrement du scan d'origine. Les facteurs clés sont la résolution (au moins 150–200 ppp, idéalement 300), l'alignement de la page (un texte très penché se reconnaît mal), l'éclairage et le contraste (les ombres du dos ou le papier jauni réduisent la précision) et la langue du texte, que l'algorithme doit connaître pour bien interpréter les lettres.

Comment lancer l'OCR, étape par étape

1. Ouvrez l'outil ocr-pdf et importez votre PDF scanné. 2. Choisissez la langue du document si on vous le demande. 3. Attendez le traitement : les scans de plusieurs pages prennent plus de temps. 4. Téléchargez le résultat. 5. Ouvrez-le et vérifiez : le texte est-il sélectionnable ? Les noms, dates et chiffres sont-ils bien reconnus ?

Ce qui peut mal tourner

  • **Beaucoup d'erreurs dans les noms et les chiffres.** La qualité du scan est trop basse. Rescannez ou rephotographiez à plus haute résolution.
  • **Aucun texte n'est reconnu.** Le PDF peut contenir des graphiques vectoriels qui ressemblent à un scan sans en être un ; l'OCR n'aide pas là.
  • **Le fichier a beaucoup grossi.** L'OCR ajoute une couche de texte et augmente un peu le poids ; s'il est trop lourd, compressez-le avec compress-pdf.
  • **L'écriture manuscrite n'est pas lisible.** L'OCR standard vise le texte imprimé ; signatures et notes en marge se reconnaissent mal ou pas du tout.

Quoi vérifier après l'OCR

  • Sélectionnez quelques lignes et collez-les dans un éditeur pour confirmer le texte.
  • Cherchez des mots-clés avec Ctrl+F : un nom, une organisation, une date.
  • Comparez chiffres et dates du texte reconnu avec l'original ; c'est là que sont les erreurs les plus fréquentes.

Conclusion

Pour rendre un PDF scanné repérable et sélectionnable, importez-le dans ocr-pdf. Pour les longs documents, divisez le fichier d'abord avec split-pdf, traitez les parties séparément et réunissez les résultats avec merge-pdf.

Questions fréquentes

L'OCR fonctionne-t-il sur le texte manuscrit ?

L'OCR standard fonctionne bien sur le texte imprimé et mal sur l'écriture à la main. Une écriture nette se reconnaît en partie, mais ce n'est pas fiable.

Puis-je copier le texte du PDF après l'OCR ?

Oui. Après traitement, le PDF devient sélectionnable : vous pouvez surligner le texte, le copier et chercher dans le document.

Pourquoi certains mots sont-ils mal reconnus ?

Presque toujours à cause du scan : taches, page de travers, basse résolution ou mauvaise lumière. Un meilleur scan donne de meilleurs résultats.

Ai-je besoin d'un compte ?

Non. Le flux de base est disponible sans créer de compte.

Combien de temps les fichiers sont-ils conservés ?

Les fichiers ne servent qu'à l'opération choisie et sont supprimés automatiquement après la fin du traitement. Nous n'utilisons pas les documents importés pour entraîner des modèles d'IA.

Plus d’articles de ce groupe

Si vous avez besoin d’une opération PDF pratique ou d’une réponse sur les limites du service après la lecture, ouvrez ces pages.

Outils associés

Étapes suivantes

Si vous avez besoin d’une opération PDF pratique ou d’une réponse sur les limites du service après la lecture, ouvrez ces pages.