Aller au contenu
Article

Convertir un PDF en Word éditable

Le fichier s'ouvre dans Word mais le curseur n'entre pas dans le texte ? Pourquoi le réglage par défaut donne une image, ce qui distingue le mode continu du mode exact, et où sont passés les en-têtes.

En bref : Pour obtenir un Word réellement modifiable, basculez le type de résultat de pdf-to-word sur continu : le mode exact, préréglé, insère chaque page en image avec une couche masquée pour la recherche. Le mode continu reconstruit paragraphes, titres et vrais tableaux Word.

Cluster

guide pas à pas

Étapes claires pour faire passer une tâche PDF de l’entrée à un résultat fiable.

13 articles

Outil principal

PDF en Word en ligne

Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.

Ouvrir l'outil

Table des matières

Convertir un PDF en Word modifiable

La demande est presque toujours la même : deux paragraphes d'un PDF reçu doivent être corrigés. Et la première tentative déçoit presque toujours. Le fichier s'ouvre dans Word, l'aspect est parfait, et le curseur refuse d'entrer dans le texte. Ce n'est pas un raté de conversion, mais la conséquence du réglage livré par défaut.

Par défaut on obtient une image, pas du texte

L'outil a deux modes, et le sélecteur entre eux s'appelle le type de résultat. C'est l'exact qui est présélectionné, et il fait exactement ce qu'il promet : il conserve l'aspect de la page lettre pour lettre. La méthode est brutale : chaque page du PDF est dessinée en image et posée entière dans le document Word.

D'où l'impression d'échange. C'est bien un .docx, il s'ouvre dans Word, les pages correspondent à l'original en taille et en orientation, et il n'y a rien à modifier : ce qui occupe la page, ce sont des images.

Le second mode, le continu, démonte la page et reconstruit avec les morceaux un vrai document Word : paragraphes, titres, listes et tableaux. Ce qui se perd en échange, c'est le placement exact des éléments sur la page.

ModeCe qu'il y a dedansCe que vous pouvez faire
ExactUne image de chaque page et une couche de texte masquéeLire, chercher dans le texte, imprimer
ContinuParagraphes, titres, listes et tableaux WordModifier le texte, changer les styles, travailler les tableaux

Le choix ne porte pas sur la qualité mais sur l'usage. Un document qui doit poursuivre sa route dans un format bureautique connu et rester intact appelle l'exact. Un document qui doit changer appelle le continu, et aucun réglage du mode exact ne produira du texte modifiable.

Ce que contient le fichier exact

L'image de la page n'est pas tout son contenu. Dessous vient aussi le texte tiré du PDF, marqué comme masqué : il est absent à l'écran et à l'impression, mais la recherche dans le document le trouve.

Cela rend le mode exact utile là où il paraît inutile. Un contrat qu'il faut diffuser puis fouiller à la recherche d'une formulation fonctionne très bien ainsi : l'aspect tient, la recherche répond, et personne ne le modifie par mégarde. L'outil le signale d'ailleurs lui-même après traitement, en avertissant que le document n'est pas du texte modifiable, et ce message mérite d'être lu plutôt que fermé.

La taille et l'orientation de la page viennent du PDF source, page par page. Une planche à l'italienne au milieu d'un document à la française reste à l'italienne.

Comment obtenir un document qui se modifie

1. Ouvrez pdf-to-word et chargez le fichier. 2. Basculez le type de résultat sur continu. C'est le geste décisif, et il n'est pas fait par défaut. 3. Décidez du sort des aperçus de page, traités plus bas, et coupez-les si vous n'en voulez pas. 4. Lancez le traitement et téléchargez le .docx. 5. Ouvrez le document et parcourez le volet de navigation : il montre quels titres ont été reconnus. 6. Vérifiez les tableaux et la première page, où les pertes se voient le plus souvent.

Les en-têtes courants disparaissent volontairement

Le mode continu fait une passe séparée sur tout le document à la recherche des lignes répétées. Deux conditions s'appliquent : la ligne doit se trouver dans le dixième supérieur ou inférieur de la page et se répéter sur au moins trois pages et sur au moins la moitié du document. Tout ce qui remplit les deux quitte le résultat.

La comparaison n'est pas naïve. Les suites de chiffres sont réduites, si bien que « Page 4 » et « Page 5 » comptent pour la même ligne. Mais la réduction ne joue que s'il reste des lettres dans la ligne : un nombre nu en pied de page est comparé à l'identique, et trois chiffres différents sur trois pages ne sont pas égaux entre eux. En pratique un pied de page « Confidentiel. Page 7 » s'en va, tandis qu'un pied de page réduit à un chiffre reste comme paragraphe sur chaque page.

Vérifié sur un rapport de quatre pages : la ligne `Confidential report Page N` est absente du résultat continu et présente dans l'exact, où la page est de toute façon une image dont on ne peut rien retirer.

Le mécanisme a aussi son revers. Un titre de document composé en gros tout en haut de chaque page, identique partout, tombe sous la même règle et disparaît avec les en-têtes. Si cette ligne du haut compte, la retaper va plus vite que d'en chercher la cause.

Les titres se décident à la taille de caractère

Les styles de titre du résultat ne sont pas inventés. L'outil calcule d'abord, pour tout le document, quelle taille de caractère constitue le corps du texte. Il compte les caractères et non les lignes, si bien qu'une rare ligne en gros corps ne remporte jamais le vote.

Chaque bloc est ensuite mesuré contre cette taille. Environ 15 pour cent plus grand que le corps donne un titre de niveau deux, une fois et demie ou plus donne le niveau un. Le reste demeure paragraphe ordinaire. Le texte doit en outre ressembler à un titre : une longue phrase terminée par un point n'en deviendra pas un, quelle que soit sa graisse.

Cela produit un comportement prévisible sur les documents composés sans styles. Si tout le texte est dans un seul corps et que les sections ne sont marquées qu'en gras, le fichier Word n'aura aucun titre : la taille ne varie pas, il n'y a rien à quoi se raccrocher. Le volet de navigation ressort vide et la structure est à poser à la main.

Les tableaux sortent en tableaux

Les tableaux sont repérés par un détecteur à part, celui-là même sur lequel repose pdf-to-excel. Un tableau détecté arrive dans le document comme véritable tableau Word, quadrillage visible, et non comme des paragraphes bourrés d'espaces.

Les blocs de texte tombant à l'intérieur des limites d'un tableau détecté sortent du flux des paragraphes ; sinon le contenu des cellules figurerait deux fois, une fois en tableau et une fois en prose. Le seuil est un recouvrement de six dixièmes de la surface du bloc.

L'endroit où atterrit le tableau est décidé par son bord supérieur : il est inséré avant le premier paragraphe qui commence en dessous de lui. Sur une page ordinaire à une colonne cela donne le bon ordre. Sur une page à deux colonnes, le tableau peut se retrouver ailleurs, parce que les paragraphes des deux colonnes se suivent dans le fichier alors que leurs hauteurs s'entrelacent.

Si la détection échoue sur une page, la tâche ne tombe pas : cette page passe en texte ordinaire et la réponse porte un avertissement nommant les pages. Une réponse vide et muette est ici impossible.

Le poids du fichier et les aperçus de page

Le mode continu ajoute par défaut, après le texte de chaque page, une image de cette page, pour avoir de quoi comparer. Rien d'autre ne pèse autant sur le résultat.

Mesuré sur un seul et même document de quatre pages :

RésultatTaille
Mode exact671 Ko
Continu avec aperçus de page315 Ko
Continu sans aperçus37 Ko

Le PDF source pesait environ 4 Ko. L'écart entre les lignes extrêmes est de dix-huit fois, et il tient entièrement aux images. Si le document part au travail réel et non à la comparaison, coupez les aperçus tout de suite : ils ne se modifient pas, ne participent pas au texte et gênent la relecture.

Le mode exact ignore complètement ce réglage, sa page étant déjà une image.

Un scan sans couche de texte

Un document scanné est une image, et il n'y a rien à en extraire. En mode exact le résultat est ce même scan remballé en .docx. En mode continu les pages sortent vides, avec une mention à la place de chacune indiquant qu'elle était blanche.

Le remède se place avant la conversion, pas après : passez le fichier par ocr-pdf, obtenez un PDF muni d'une couche de texte et convertissez seulement ensuite vers Word. L'ordre inverse ne marche pas, car il ne restera plus rien à reconnaître.

Un document fermé par un mot de passe d'ouverture ne se convertit pas davantage ; la tâche s'arrête et réclame le mot de passe. Levez la protection avec unlock-pdf. Un mot de passe qui limite seulement l'impression ou la copie ne gêne pas.

Une fois les corrections faites, le document doit d'ordinaire repartir en PDF. C'est word-to-pdf, avec son propre comportement de substitution de polices, qu'il vaut mieux connaître à l'avance.

FAQ

Parce que le type de résultat est préréglé sur exact : chaque page est insérée en image, avec dessous une couche de texte masquée pour la recherche. Pour un document modifiable, basculez le type de résultat sur continu et reconvertissez.
En mode continu, les tableaux détectés passent en véritables tableaux Word au quadrillage visible. Si la détection échoue sur une page, son contenu passe en texte ordinaire et la réponse porte un avertissement nommant ces pages.
Le mode continu retire les lignes situées dans le dixième supérieur ou inférieur de la page et répétées sur au moins trois pages et sur au moins la moitié du document. Un titre de document identique en haut de chaque page tombe sous la même règle.
Pas directement. Un scan n'a pas de couche de texte, le mode continu renvoie donc des pages vides. Passez d'abord le fichier par ocr-pdf, puis convertissez vers Word le PDF obtenu.
Les fichiers ne servent qu'à l'opération choisie et sont supprimés automatiquement une fois le traitement terminé. Nous n'utilisons pas les documents envoyés pour entraîner des modèles d'IA.

Plus de ce cluster

Outils associés

← Tous les outils Convertir

Que faire ensuite

Si vous avez besoin d'une étape pratique ou d'un repère sur le service après la lecture, ouvrez ces pages.

Tous les outils

Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.

FAQ

Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.

Contact

Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.