Vous recevez un PDF avec un contrat, un certificat ou un formulaire scanné. Vous tentez de sélectionner du texte et rien ne se passe : le curseur se comporte comme si la page était une image. Et c'est exactement ce qu'elle est, une image scannée sans couche de texte en dessous. L'OCR (reconnaissance optique de caractères) ajoute cette couche et transforme l'image en un document où le texte se sélectionne, se copie et se recherche.
Quand vous avez besoin de l'OCR
L'OCR est utile quand vous avez un PDF scanné et voulez copier un passage sans le retaper, chercher un mot avec Ctrl+F, reprendre le contenu dans un autre outil sans le ressaisir ou rendre un document archivé repérable par mot-clé. Si le PDF a déjà une couche de texte — vous pouvez donc sélectionner des mots — l'OCR est inutile.
De quoi dépend la qualité
La qualité du résultat dépend presque entièrement du scan d'origine. Les facteurs clés sont la résolution (au moins 150–200 ppp, idéalement 300), l'alignement de la page (un texte très penché se reconnaît mal), l'éclairage et le contraste (les ombres du dos ou le papier jauni réduisent la précision) et la langue du texte, que l'algorithme doit connaître pour bien interpréter les lettres.
Comment lancer l'OCR, étape par étape
1. Ouvrez l'outil ocr-pdf et importez votre PDF scanné. 2. Choisissez la langue du document si on vous le demande. 3. Attendez le traitement : les scans de plusieurs pages prennent plus de temps. 4. Téléchargez le résultat. 5. Ouvrez-le et vérifiez : le texte est-il sélectionnable ? Les noms, dates et chiffres sont-ils bien reconnus ?
Ce qui peut mal tourner
- **Beaucoup d'erreurs dans les noms et les chiffres.** La qualité du scan est trop basse. Rescannez ou rephotographiez à plus haute résolution.
- **Aucun texte n'est reconnu.** Le PDF peut contenir des graphiques vectoriels qui ressemblent à un scan sans en être un ; l'OCR n'aide pas là.
- **Le fichier a beaucoup grossi.** L'OCR ajoute une couche de texte et augmente un peu le poids ; s'il est trop lourd, compressez-le avec compress-pdf.
- **L'écriture manuscrite n'est pas lisible.** L'OCR standard vise le texte imprimé ; signatures et notes en marge se reconnaissent mal ou pas du tout.
Quoi vérifier après l'OCR
- Sélectionnez quelques lignes et collez-les dans un éditeur pour confirmer le texte.
- Cherchez des mots-clés avec Ctrl+F : un nom, une organisation, une date.
- Comparez chiffres et dates du texte reconnu avec l'original ; c'est là que sont les erreurs les plus fréquentes.
Conclusion
Pour rendre un PDF scanné repérable et sélectionnable, importez-le dans ocr-pdf. Pour les longs documents, divisez le fichier d'abord avec split-pdf, traitez les parties séparément et réunissez les résultats avec merge-pdf.