Comment faire l'OCR d'un PDF scanné
En bref : L'OCR ne change pas l'aspect de la page : une couche de texte invisible se pose sur l'image, et la recherche comme la copie se mettent à fonctionner. Les pages qui portent déjà du texte sont ignorées. Le mode de qualité est en fait une résolution de rendu : rapide donne 100 DPI, précis donne 300.
Cluster
guide pas à pas
Étapes claires pour faire passer une tâche PDF de l’entrée à un résultat fiable.
Outil principal
PDF ROC en ligne
Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.
Ouvrir l'outilTable des matières
- Ce qui est réellement ajouté au fichier
- Les pages qui portent déjà du texte sont ignorées
- Les trois modes de qualité sont trois résolutions
- La langue : automatique signifie deux langues à la fois
- Comment lancer la reconnaissance
- Le redressement et ce qu'il coûte
- Ce que la reconnaissance ne fait pas
- Où placer la reconnaissance dans la chaîne des opérations
Reconnaissance de texte dans un PDF : ce qui arrive à une numérisation
Un document numérisé ressemble à un document et se lit comme un document, mais pour n'importe quel programme c'est une image. On ne peut pas y chercher, on ne peut pas en copier un numéro de contrat, et un formulaire qui contrôle la présence de texte le refuse comme fichier vide.
La reconnaissance règle exactement cela, et d'une manière qu'il vaut mieux comprendre : elle ne réécrit rien.
Ce qui est réellement ajouté au fichier
L'image de la page reste intacte. Par-dessus se pose une seconde couche : du texte placé là où se trouvent les lettres correspondantes sur l'image, et rendu invisible.
Toutes les propriétés du résultat en découlent. Visuellement le fichier ne se distingue pas de l'original : même papier, mêmes tampons, même inclinaison s'il y en avait une. En même temps la recherche trouve des mots, un double clic sélectionne une ligne, et la copie rend du vrai texte.
Le même fait explique pourquoi la reconnaissance est sans danger pour les documents dont l'aspect compte. Un contrat numérisé avec signature reste, après l'OCR, la même numérisation avec la même signature ; il est simplement devenu consultable.
Les pages qui portent déjà du texte sont ignorées
Avant traitement, chaque page est contrôlée pour une couche de texte, et celles qui en ont ne sont pas reconnues du tout.
Deux conséquences pratiques en découlent.
Les documents mixtes sont traités correctement sans effort. Si une partie d'un fichier a été saisie dans un éditeur et l'autre collée en numérisation, seule la seconde est reconnue. Le texte saisi reste l'original au lieu d'être remplacé par une copie reconnue, ce qui compte : le texte d'origine est exact, le texte reconnu comporte des erreurs.
Passer un PDF texte ordinaire à l'OCR ne fait presque rien et n'abîme rien. C'est commode quand on ignore si le document devant soi est une numérisation : il suffit de le faire passer par l'outil.
La même logique gouverne la durée. Elle dépend non du nombre de pages du document mais du nombre de pages sans texte. Un rapport de deux cents pages avec cinq numérisations collées se traite dans le temps de cinq pages.
Les trois modes de qualité sont trois résolutions
Le choix de la qualité pilote une seule grandeur : la résolution à laquelle la page est dessinée avant la reconnaissance.
| Mode | Résolution | Quand le prendre |
|---|---|---|
| Rapide | 100 DPI | Caractères grands et nets, contrôle sommaire |
| Équilibré | 150 DPI | Documents courants, contrats, attestations |
| Précis | 300 DPI | Petits caractères, notes de bas de page, mauvaises copies |
Le mode rapide est celui par défaut, et cela mérite d'être retenu. Cent points par pouce suffisent pour des titres et un corps de texte en douze points, mais les petites notes, les chiffres des tableaux et les tampons ressortent nettement moins bien à ce rendu.
La règle est simple : si le document contient quelque chose que vous lisez vous-même en plissant les yeux, choisissez le mode précis. Il est plus lent, et il évite de refaire le travail.
La langue : automatique signifie deux langues à la fois
L'anglais et le russe sont disponibles, ainsi qu'un mode automatique.
Le mode automatique ne devine pas la langue. Il reconnaît le document dans les deux à la fois, ce qui convient à un texte où une langue est parsemée de noms, de codes et de termes de l'autre. Le prix en est la vitesse et une légère perte de précision sur un texte homogène.
Si le document est entièrement dans une langue, choisir cette langue donne un résultat un peu meilleur et plus rapide.
Quand la langue choisie n'est pas disponible, la reconnaissance n'échoue pas : elle s'exécute avec celle qui est installée et joint un avertissement distinct nommant la langue demandée et celle appliquée. Cet avertissement mérite d'être lu plutôt que fermé : une langue substituée en silence explique un résultat étrange mieux que n'importe quelle conjecture.
Une note sur les documents en d'autres langues. L'écriture latine est reconnue par le jeu anglais, mais les signes diacritiques se perdent ou se déforment en chemin : les textes français et allemands ressortent lisibles avec des erreurs dans les accents. Les systèmes d'écriture autres que le latin et le cyrillique ne sont pas pris en charge du tout.
Comment lancer la reconnaissance
1. Ouvrez ocr-pdf et chargez le document. 2. Choisissez la langue. Automatique pour un texte mêlé, une langue précise pour un texte homogène. 3. Mettez le mode précis si le document contient de petits caractères. 4. Lancez le traitement et téléchargez le résultat. 5. Ouvrez le fichier et cherchez un mot dont vous savez qu'il figure sur la numérisation. C'est le contrôle le plus rapide qui soit.
Le redressement et ce qu'il coûte
Un interrupteur distinct redresse les pages inclinées avant la reconnaissance. Il est désactivé par défaut, et il y a une raison.
Le redressement s'applique à une copie temporaire de la page, celle que lit la reconnaissance, et la couche de texte se pose ensuite sur la page d'origine non corrigée. Sur une numérisation fortement inclinée, cela produit un décalage : le texte invisible se retrouve pivoté par rapport aux lettres visibles.
La recherche n'en souffre pas, le mot est trouvé quand même. La sélection à la souris en souffre : le cadre de sélection tombe à côté des lettres, et copier un passage devient malaisé.
Le compromis est délibéré, car les pages d'origine restent intactes. Si l'inclinaison est forte, mieux vaut redresser le document avant la reconnaissance, avec rotate-pdf pour des rotations à angle droit ou en refaisant la numérisation via scan-to-pdf, qui redresse réellement.
Ce que la reconnaissance ne fait pas
Elle n'améliore pas la source. Une photo floue, le reflet d'une lampe en travers d'une ligne, l'ombre d'une main sur une demi-page : tout cela demeure, et la reconnaissance à cet endroit donne du charabia ou saute le passage.
Elle ne lit pas l'écriture manuscrite. L'outil est prévu pour des caractères imprimés.
Elle ne produit pas de texte juridiquement valable. La couche reconnue comporte des erreurs et ne vaut pas copie du document. Elle existe pour la recherche et pour les systèmes qui exigent une couche de texte, pas pour citer.
Et elle ne restitue pas de résolution. Si la numérisation d'origine a été faite à 75 points par pouce, le mode précis la dessine à 300, mais aucune lettre supplémentaire n'apparaît : une image floue devient simplement plus grande. La qualité de reconnaissance est fixée par la source, pas par le réglage.
Où placer la reconnaissance dans la chaîne des opérations
L'ordre compte plus qu'il n'y paraît, et une règle domine : la reconnaissance passe avant la compression.
La reconnaissance travaille sur l'image de la page. La compression via compress-pdf dégrade cette image : elle abaisse la résolution et ajoute des artefacts autour des lettres. L'ordre inverse produit sensiblement plus d'erreurs dans le texte, et rien ne permet ensuite de les corriger.
L'assemblage et les rotations vont eux aussi avant la reconnaissance : ils changent quelles pages existent et comment elles sont orientées, et la couche de texte est liée à une page précise.
Si ce qu'il vous faut n'est pas un fichier doté d'une couche de texte mais le texte lui-même dans un fichier à part, pdf-to-text est fait pour cela : il extrait le contenu dans un fichier texte simple découpé par page.
FAQ
Plus de ce cluster
guide pas à pas
Convertir un PDF en Word éditable
Le fichier s'ouvre dans Word mais le curseur n'entre pas dans le texte ? Pourquoi le réglage par défaut donne une image, ce qui distingue le mode continu du mode exact, et où sont passés les en-têtes.
guide pas à pas
Extraire des tableaux PDF vers Excel
Du PDF vers Excel : quelles feuilles se retrouvent dans le classeur téléchargé, ce qui distingue en pratique les trois modes de détection, et pourquoi le mode souple trouve plus de tableaux mais casse les mots.
guide pas à pas
Extraire des pages d'un PDF
Sortir d'un PDF les feuillets voulus dans un fichier à part : ce qui distingue les deux modes de sortie, pourquoi les fichiers de l'archive conservent les numéros de page d'origine, et ce que fait la désactivation de la conservation de taille.
Outils associés
PDF ROC en ligne
PDF ROC garde la tâche PDF dans un seul flux navigateur: importer le fichier, vérifier les options, traiter et télécharger le résultat.
PDF en texte en ligne
Extrayez le texte d’un PDF dans un fichier texte brut pour copier le contenu sans mise en forme ni mise en page.
Compresser PDF en ligne
Réduisez la taille d'un PDF pour l'envoyer, le téléverser ou le stocker plus facilement. Particulièrement utile pour les scans et documents avec images.
Faire pivoter PDF en ligne
Corrigez l'orientation des pages PDF lorsqu'un scan ou certaines feuilles sont de côté ou à l'envers.
Que faire ensuite
Tous les outils
Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.
FAQ
Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.
Contact
Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.