Aller au contenu
Article

Extraire des tableaux PDF vers Excel

Du PDF vers Excel : quelles feuilles se retrouvent dans le classeur téléchargé, ce qui distingue en pratique les trois modes de détection, et pourquoi le mode souple trouve plus de tableaux mais casse les mots.

En bref : Pour faire passer des tableaux d'un PDF vers Excel, ouvrez pdf-to-excel et laissez la détection sur auto. Le classeur contient une feuille de sommaire, une feuille de texte, une image de chaque page et une feuille de cellules réelles par tableau trouvé.

Cluster

guide pas à pas

Étapes claires pour faire passer une tâche PDF de l’entrée à un résultat fiable.

13 articles

Outil principal

PDF en Excel en ligne

Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.

Ouvrir l'outil

Table des matières

Faire passer des tableaux d'un PDF vers Excel

Un rapport contient un tableau, et il faut le recalculer plutôt que le retaper. L'outil en fait pour cela davantage que son nom ne le laisse croire : il ne se contente pas de déverser du texte, il monte un classeur de plusieurs feuilles aux rôles distincts. Comprendre comment ce classeur est bâti se rentabilise avant le premier essai.

Ce que contient réellement le fichier téléchargé

Le résultat n'est pas une feuille de données. C'est un classeur dont les feuilles jouent des rôles différents.

FeuilleCe qu'elle porte
SommaireUn index des pages avec des liens vers les autres feuilles
TexteLe texte du document, une ligne par page
Page NUne image de la page entière du PDF
Tableau N.MUn tableau détecté en cellules réelles

C'est pour la dernière ligne que tout se joue. Les feuilles de tableaux portent des données sur lesquelles poser des formules. Les images de page et la feuille de texte sont l'assurance au cas où un tableau n'aurait pas été détecté : le contenu reste sous les yeux de toute façon.

La feuille de sommaire fonctionne comme une table des matières : le numéro de page, un lien vers la feuille de cette page et la première ligne de son texte pour se repérer. Les liens sautent à l'intérieur du classeur.

Trois modes de détection

Le paramètre de détection change la façon dont l'outil cherche les bords des cellules, et cela change le résultat plus que tout le reste.

ModeComment il trouve le tableauCe que contient le classeur
AutoPar les traits du quadrillageToutes les feuilles, celle de texte comprise
StrictPar les traits, avec des exigences dures sur leurs croisementsAucune feuille de texte
SouplePar l'emplacement du texte, sans s'appuyer sur des traitsToutes les feuilles, plus le texte entier de la page dans un commentaire de cellule

Auto est le mode par défaut. Le strict s'en distingue par plus que sa méfiance envers les traits : il retire du classeur la feuille de texte et ne laisse que les tableaux et les images. Cela se justifie quand le résultat alimente un traitement ultérieur et que les feuilles en trop gênent.

Le souple est le seul mode qui voie les tableaux sans quadrillage. Cela se paie, et le prix est élevé.

Il a par ailleurs un effet secondaire parfois plus utile que sa fonction principale : en mode souple, le texte entier de la page atterrit aussi dans un commentaire attaché à la première cellule de la feuille portant l'image. En survolant, on lit le contenu de la page sans basculer vers la feuille de texte.

Ce qu'a montré la mesure

Le sujet : un document dont la première page porte deux tableaux, l'un avec des traits, l'autre sans, de simples colonnes alignées.

Auto et strict n'ont trouvé que le premier, et l'ont transféré sans faute : trois lignes, trois colonnes, valeurs à leur place.

Le souple a trouvé les deux, mais les a rassemblés en une seule grille et a cassé des mots entre les colonnes au passage. Le mot « Region » est devenu deux cellules, « Re » et « gion ». « North » s'est mué en « No » et « rth ». Le nombre 900 s'est scindé en « 9 » et « 00 ». Des lignes vides sont apparues entre les lignes de données.

Conclusion pratique : commencez par auto. Si aucun tableau ne sort et que le document est réellement dépourvu de traits, passez au souple, mais prévoyez du temps pour l'assembler à la main. Il fournit de la matière, pas un résultat fini.

Et l'inverse : si le tableau du PDF est dessiné avec des traits et que le résultat reste vide, le mode n'est pas en cause. Le document n'a très probablement pas de couche de texte.

Comment faire passer le tableau

1. Ouvrez pdf-to-excel et chargez le document. 2. Laissez la détection sur auto pour le premier essai. 3. Lancez le traitement et téléchargez le classeur. 4. Ouvrez la feuille de sommaire et sautez vers les feuilles de tableaux. 5. Confrontez les nombres de deux ou trois lignes à l'image de la page sur la feuille voisine. 6. Si aucun tableau n'est sorti, recommencez en mode souple.

Le cinquième point existe précisément parce que l'image de la page est dans le même classeur. Confronter ce qui est passé à l'original n'oblige jamais à quitter Excel.

Cellules fusionnées et tri

L'interrupteur de fusion est activé par défaut. Il concerne les cellules qui, dans le tableau d'origine, s'étendent sur plusieurs colonnes : activé, il les rétablit en véritables plages fusionnées et reproduit l'aspect de l'original.

Désactivé, il casse ces cellules en cellules ordinaires : la valeur reste dans la première, les autres deviennent vides.

Choisissez selon ce que vous comptez faire des données.

Si le tableau doit être lu et imprimé, laissez la fusion activée : le résultat coïncide avec l'original.

Si les données doivent être triées, filtrées ou passées en tableau croisé, désactivez-la. Excel refuse de trier une plage contenant des cellules fusionnées et exige qu'elles aient toutes la même taille. Défaire les fusions à la main ensuite prend plus de temps que de basculer l'interrupteur avant.

Pourquoi le fichier pèse plus que prévu

Chaque page du PDF entre dans le classeur comme feuille propre portant une image en taille réelle, rendue à presque deux fois la résolution. Ces images font presque tout le poids du résultat.

Sur un petit document d'essai l'écart saute aux yeux : le PDF source pesait 2 Ko et le classeur est sorti autour de 45 Ko. Sur de vrais rapports le compte se fait en mégaoctets, et il croît avec le nombre de pages, pas avec celui des tableaux.

Si seules les données comptent et que les images gênent, les feuilles superflues se suppriment dans Excel en deux gestes, et le fichier maigrit à l'enregistrement.

Un scan, et un tableau sans couche de texte

L'outil lit du texte, il ne le reconnaît pas. Un tableau scanné est pour lui une image : l'image de la page sera dans le classeur, la feuille de texte ressortira vide, et aucun mode ne trouvera de tableau.

Le remède se place avant la conversion : passez le fichier par ocr-pdf, obtenez une couche de texte, et convertissez ensuite en feuille de calcul. L'ordre inverse ne sert à rien, puisqu'il ne reste plus rien à reconnaître pour Excel.

La même astuce aide pour les documents dont le texte existe mais penche : une page prise de biais se reconnaît moins bien qu'une page droite, et la redresser avant la reconnaissance change nettement le résultat.

Limites, avertissements et outils voisins

Si la détection de tableaux échoue sur une page, la tâche ne tombe pas. Le classeur arrive entier et la réponse porte un avertissement nommant ces pages : il n'en sortira aucun tableau, l'image et le texte restent. Idem pour les pages dont le texte n'a pas pu être lu.

Un document sous mot de passe d'ouverture ne peut pas être traité ; levez la protection avec unlock-pdf. Un mot de passe qui limite seulement l'impression ou la copie ne gêne pas l'extraction des tableaux.

Quand une page porte plusieurs tableaux, chacun reçoit sa feuille, nommée d'après le numéro de page et le rang du tableau sur celle-ci. Excel plafonne la longueur des noms de feuille : les libellés longs sont rognés et les homonymies séparées par un suffixe chiffré.

Si ce qu'il vous faut du document est du texte à modifier plutôt que des tableaux, c'est pdf-to-word en mode continu : le même détecteur les y transporte en véritables tableaux Word. Et ramener le classeur terminé en PDF, c'est excel-to-pdf.

FAQ

Vérifiez d'abord si le tableau possède des traits : les modes auto et strict cherchent les bords de cellules le long des traits. Un tableau sans quadrillage n'est visible que du mode souple. Si les traits sont là et que le résultat reste vide, le document n'a probablement pas de couche de texte et réclame un OCR.
Il s'appuie sur l'emplacement du texte et non sur les traits, et lors de la mesure il a cassé des mots entre colonnes : Region est devenu Re et gion, et le nombre 900 s'est scindé en 9 et 00. Il donne de la matière à assembler à la main, pas un tableau fini.
À cause des cellules fusionnées : l'interrupteur de fusion est activé par défaut et rétablit les cellules qui s'étendaient sur plusieurs colonnes. Si les données doivent être triées ou passées en tableau croisé, désactivez-le avant le traitement.
Chaque page du PDF y entre comme feuille propre portant une image en taille réelle. Ces images font presque tout le poids. Si seules les données comptent, les feuilles superflues se suppriment dans Excel et le fichier maigrit à l'enregistrement.
Les fichiers ne servent qu'à l'opération choisie et sont supprimés automatiquement une fois le traitement terminé. Nous n'utilisons pas les documents envoyés pour entraîner des modèles d'IA.

Plus de ce cluster

Outils associés

← Tous les outils Convertir

Que faire ensuite

Si vous avez besoin d'une étape pratique ou d'un repère sur le service après la lecture, ouvrez ces pages.

Tous les outils

Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.

FAQ

Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.

Contact

Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.