Convertir un PDF en Word éditable
En bref : Pour obtenir un Word réellement modifiable, basculez le type de résultat de pdf-to-word sur continu : le mode exact, préréglé, insère chaque page en image avec une couche masquée pour la recherche. Le mode continu reconstruit paragraphes, titres et vrais tableaux Word.
Cluster
guide pas à pas
Étapes claires pour faire passer une tâche PDF de l’entrée à un résultat fiable.
Outil principal
PDF en Word en ligne
Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.
Ouvrir l'outilTable des matières
- Par défaut on obtient une image, pas du texte
- Ce que contient le fichier exact
- Comment obtenir un document qui se modifie
- Les en-têtes courants disparaissent volontairement
- Les titres se décident à la taille de caractère
- Les tableaux sortent en tableaux
- Le poids du fichier et les aperçus de page
- Un scan sans couche de texte
Convertir un PDF en Word modifiable
La demande est presque toujours la même : deux paragraphes d'un PDF reçu doivent être corrigés. Et la première tentative déçoit presque toujours. Le fichier s'ouvre dans Word, l'aspect est parfait, et le curseur refuse d'entrer dans le texte. Ce n'est pas un raté de conversion, mais la conséquence du réglage livré par défaut.
Par défaut on obtient une image, pas du texte
L'outil a deux modes, et le sélecteur entre eux s'appelle le type de résultat. C'est l'exact qui est présélectionné, et il fait exactement ce qu'il promet : il conserve l'aspect de la page lettre pour lettre. La méthode est brutale : chaque page du PDF est dessinée en image et posée entière dans le document Word.
D'où l'impression d'échange. C'est bien un .docx, il s'ouvre dans Word, les pages correspondent à l'original en taille et en orientation, et il n'y a rien à modifier : ce qui occupe la page, ce sont des images.
Le second mode, le continu, démonte la page et reconstruit avec les morceaux un vrai document Word : paragraphes, titres, listes et tableaux. Ce qui se perd en échange, c'est le placement exact des éléments sur la page.
| Mode | Ce qu'il y a dedans | Ce que vous pouvez faire |
|---|---|---|
| Exact | Une image de chaque page et une couche de texte masquée | Lire, chercher dans le texte, imprimer |
| Continu | Paragraphes, titres, listes et tableaux Word | Modifier le texte, changer les styles, travailler les tableaux |
Le choix ne porte pas sur la qualité mais sur l'usage. Un document qui doit poursuivre sa route dans un format bureautique connu et rester intact appelle l'exact. Un document qui doit changer appelle le continu, et aucun réglage du mode exact ne produira du texte modifiable.
Ce que contient le fichier exact
L'image de la page n'est pas tout son contenu. Dessous vient aussi le texte tiré du PDF, marqué comme masqué : il est absent à l'écran et à l'impression, mais la recherche dans le document le trouve.
Cela rend le mode exact utile là où il paraît inutile. Un contrat qu'il faut diffuser puis fouiller à la recherche d'une formulation fonctionne très bien ainsi : l'aspect tient, la recherche répond, et personne ne le modifie par mégarde. L'outil le signale d'ailleurs lui-même après traitement, en avertissant que le document n'est pas du texte modifiable, et ce message mérite d'être lu plutôt que fermé.
La taille et l'orientation de la page viennent du PDF source, page par page. Une planche à l'italienne au milieu d'un document à la française reste à l'italienne.
Comment obtenir un document qui se modifie
1. Ouvrez pdf-to-word et chargez le fichier. 2. Basculez le type de résultat sur continu. C'est le geste décisif, et il n'est pas fait par défaut. 3. Décidez du sort des aperçus de page, traités plus bas, et coupez-les si vous n'en voulez pas. 4. Lancez le traitement et téléchargez le .docx. 5. Ouvrez le document et parcourez le volet de navigation : il montre quels titres ont été reconnus. 6. Vérifiez les tableaux et la première page, où les pertes se voient le plus souvent.
Les en-têtes courants disparaissent volontairement
Le mode continu fait une passe séparée sur tout le document à la recherche des lignes répétées. Deux conditions s'appliquent : la ligne doit se trouver dans le dixième supérieur ou inférieur de la page et se répéter sur au moins trois pages et sur au moins la moitié du document. Tout ce qui remplit les deux quitte le résultat.
La comparaison n'est pas naïve. Les suites de chiffres sont réduites, si bien que « Page 4 » et « Page 5 » comptent pour la même ligne. Mais la réduction ne joue que s'il reste des lettres dans la ligne : un nombre nu en pied de page est comparé à l'identique, et trois chiffres différents sur trois pages ne sont pas égaux entre eux. En pratique un pied de page « Confidentiel. Page 7 » s'en va, tandis qu'un pied de page réduit à un chiffre reste comme paragraphe sur chaque page.
Vérifié sur un rapport de quatre pages : la ligne `Confidential report Page N` est absente du résultat continu et présente dans l'exact, où la page est de toute façon une image dont on ne peut rien retirer.
Le mécanisme a aussi son revers. Un titre de document composé en gros tout en haut de chaque page, identique partout, tombe sous la même règle et disparaît avec les en-têtes. Si cette ligne du haut compte, la retaper va plus vite que d'en chercher la cause.
Les titres se décident à la taille de caractère
Les styles de titre du résultat ne sont pas inventés. L'outil calcule d'abord, pour tout le document, quelle taille de caractère constitue le corps du texte. Il compte les caractères et non les lignes, si bien qu'une rare ligne en gros corps ne remporte jamais le vote.
Chaque bloc est ensuite mesuré contre cette taille. Environ 15 pour cent plus grand que le corps donne un titre de niveau deux, une fois et demie ou plus donne le niveau un. Le reste demeure paragraphe ordinaire. Le texte doit en outre ressembler à un titre : une longue phrase terminée par un point n'en deviendra pas un, quelle que soit sa graisse.
Cela produit un comportement prévisible sur les documents composés sans styles. Si tout le texte est dans un seul corps et que les sections ne sont marquées qu'en gras, le fichier Word n'aura aucun titre : la taille ne varie pas, il n'y a rien à quoi se raccrocher. Le volet de navigation ressort vide et la structure est à poser à la main.
Les tableaux sortent en tableaux
Les tableaux sont repérés par un détecteur à part, celui-là même sur lequel repose pdf-to-excel. Un tableau détecté arrive dans le document comme véritable tableau Word, quadrillage visible, et non comme des paragraphes bourrés d'espaces.
Les blocs de texte tombant à l'intérieur des limites d'un tableau détecté sortent du flux des paragraphes ; sinon le contenu des cellules figurerait deux fois, une fois en tableau et une fois en prose. Le seuil est un recouvrement de six dixièmes de la surface du bloc.
L'endroit où atterrit le tableau est décidé par son bord supérieur : il est inséré avant le premier paragraphe qui commence en dessous de lui. Sur une page ordinaire à une colonne cela donne le bon ordre. Sur une page à deux colonnes, le tableau peut se retrouver ailleurs, parce que les paragraphes des deux colonnes se suivent dans le fichier alors que leurs hauteurs s'entrelacent.
Si la détection échoue sur une page, la tâche ne tombe pas : cette page passe en texte ordinaire et la réponse porte un avertissement nommant les pages. Une réponse vide et muette est ici impossible.
Le poids du fichier et les aperçus de page
Le mode continu ajoute par défaut, après le texte de chaque page, une image de cette page, pour avoir de quoi comparer. Rien d'autre ne pèse autant sur le résultat.
Mesuré sur un seul et même document de quatre pages :
| Résultat | Taille |
|---|---|
| Mode exact | 671 Ko |
| Continu avec aperçus de page | 315 Ko |
| Continu sans aperçus | 37 Ko |
Le PDF source pesait environ 4 Ko. L'écart entre les lignes extrêmes est de dix-huit fois, et il tient entièrement aux images. Si le document part au travail réel et non à la comparaison, coupez les aperçus tout de suite : ils ne se modifient pas, ne participent pas au texte et gênent la relecture.
Le mode exact ignore complètement ce réglage, sa page étant déjà une image.
Un scan sans couche de texte
Un document scanné est une image, et il n'y a rien à en extraire. En mode exact le résultat est ce même scan remballé en .docx. En mode continu les pages sortent vides, avec une mention à la place de chacune indiquant qu'elle était blanche.
Le remède se place avant la conversion, pas après : passez le fichier par ocr-pdf, obtenez un PDF muni d'une couche de texte et convertissez seulement ensuite vers Word. L'ordre inverse ne marche pas, car il ne restera plus rien à reconnaître.
Un document fermé par un mot de passe d'ouverture ne se convertit pas davantage ; la tâche s'arrête et réclame le mot de passe. Levez la protection avec unlock-pdf. Un mot de passe qui limite seulement l'impression ou la copie ne gêne pas.
Une fois les corrections faites, le document doit d'ordinaire repartir en PDF. C'est word-to-pdf, avec son propre comportement de substitution de polices, qu'il vaut mieux connaître à l'avance.
FAQ
Plus de ce cluster
guide pas à pas
Extraire des tableaux PDF vers Excel
Du PDF vers Excel : quelles feuilles se retrouvent dans le classeur téléchargé, ce qui distingue en pratique les trois modes de détection, et pourquoi le mode souple trouve plus de tableaux mais casse les mots.
guide pas à pas
Extraire des pages d'un PDF
Sortir d'un PDF les feuillets voulus dans un fichier à part : ce qui distingue les deux modes de sortie, pourquoi les fichiers de l'archive conservent les numéros de page d'origine, et ce que fait la désactivation de la conservation de taille.
guide pas à pas
Rogner les marges et le superflu d'un PDF
Le rognage ne change que la zone visible de la page, tandis que le contenu au-delà reste dans le fichier. Ce que cela signifie en pratique, pourquoi les marges s'appliquent à tout le document et comment le rognage se comporte sur des pages pivotées.
Outils associés
PDF en Word en ligne
Convertissez un PDF en document Word pour modifier le texte, compléter des sections et apporter des changements.
Word en PDF en ligne
Convertissez un document Word en PDF pour figer la mise en page et garantir une ouverture identique partout.
PDF en Excel en ligne
Extrayez les données de tableaux d’un PDF vers Excel pour les calculer, les filtrer et les trier.
PDF ROC en ligne
PDF ROC garde la tâche PDF dans un seul flux navigateur: importer le fichier, vérifier les options, traiter et télécharger le résultat.
Que faire ensuite
Tous les outils
Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.
FAQ
Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.
Contact
Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.