Aller au contenu
Article

HTML en PDF : sauver une page web

L'outil accepte un fichier HTML enregistré et non une adresse, puis le dessine dans un navigateur isolé. D'où les règles : les images locales ne sont pas chargées, et tout ce qui apparaît après le chargement n'atteint jamais le PDF.

En bref : La page est dessinée par un navigateur sans interface à partir du fichier HTML que vous chargez. Les chemins locaux ne sont pas sollicités du tout, et les adresses externes seulement si elles figurent dans le HTML lui-même. Une archive fiable vient d'un fichier unique et autonome où tout est incorporé.

Cluster

sécurité

Flux de protection, de contrôle d’accès, de masquage et de partage contrôlé.

4 articles

Outil principal

HTML en PDF en ligne

Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.

Ouvrir l'outil

Table des matières

Enregistrer une page web en PDF : ce qui atteint l'archive et ce qui n'y arrive pas

Il faut conserver une page de sorte que dans un an elle s'ouvre et ressemble à ce qu'elle est aujourd'hui : des conditions générales, une page de tarifs, un article que quelqu'un pourrait modifier. Le PDF convient mieux qu'une capture, parce que le texte survit, et mieux qu'un signet, parce qu'il ne dépend pas du serveur d'autrui.

Mais entre « page dans le navigateur » et « page en PDF » il y a quelques étapes où du contenu se perd. Voyons lesquelles.

L'outil accepte un fichier, pas une adresse de page

Première chose à comprendre : on n'y saisit pas l'adresse d'un site. On charge un fichier HTML enregistré.

Votre navigateur sait enregistrer la page. La boîte de dialogue propose en général de choisir entre HTML seul et une option qui emballe la page entière. La seconde est nettement meilleure : elle réunit balisage, styles et images dans un fichier, et c'est ce dont une archive a besoin.

Pourquoi c'est ainsi, la section suivante l'explique, et cette même explication couvre la plupart des résultats surprenants.

Pourquoi les images disparaissent

La page est dessinée dans un navigateur isolé, et le contenu lui est remis directement plutôt qu'ouvert depuis un chemin de fichier. Une telle page n'a pas d'emplacement sur le disque d'où lire des fichiers voisins.

D'où une règle stricte : les références à des fichiers locaux ne fonctionnent pas. Si un dossier `page_files` plein d'images se trouve à côté de votre `page.html`, aucune n'atteint le PDF. Le navigateur ne peut tout simplement pas y accéder.

Les adresses externes fonctionnent, mais pas n'importe lesquelles. Avant le rendu, le HTML est analysé statiquement, une liste d'adresses en est tirée, et seules celles-là sont récupérées. Une ressource dont le balisage ne dit rien est bloquée, et une redirection vers une autre adresse également.

Il en découle une conclusion pratique : une archive fiable vient d'un fichier autonome, où images et styles sont incorporés au balisage plutôt que posés à côté.

Tout ce qui apparaît après le chargement n'atteint pas le PDF

La deuxième source de pertes, c'est la dynamique.

Une page moderne charge souvent du contenu après son ouverture : images au défilement, commentaires au clic, tableau de données en requête séparée. Le rendu travaille sur le balisage et non sur la page vivante, et ce qui se charge plus tard n'y figure pas.

Pour la même raison, les blocs repliés restent repliés, les onglets autres que l'actif manquent, et tout ce qui s'affiche au survol est absent.

Vous pouvez le vérifier à l'avance : désactivez les scripts dans le navigateur et rechargez la page. Ce qui reste visible atteindra le PDF. Ce qui disparaît, non.

En quoi une archive PDF diffère d'une capture et d'un signet

Trois façons de conserver une page résolvent des problèmes différents, et les confondre coûte cher.

MéthodeCe qui est conservéCe qui manque
SignetRien sinon l'adresseLa page peut changer ou disparaître
CaptureUne image de la zone visibleLe texte ne se cherche ni ne se copie, une longue page ne tient pas
PDFTexte, mise en forme, toutes les pages entièresL'interactivité et ce que chargent les scripts

Pour une tâche probatoire, c'est la troisième colonne de la deuxième ligne qui compte. Une capture d'une page de tarifs ne permet pas de retrouver une clause par recherche et ne montre pas ce qui figurait plus bas. Le PDF fait les deux.

À retenir séparément : aucune des trois n'est une preuve juridique du contenu d'une page à une date. Le constat notarié existe pour cela, et il fonctionne autrement.

Comment procéder à l'enregistrement

1. Ouvrez la page dans un navigateur et enregistrez-la en HTML, en choisissant l'option fichier unique. 2. Ouvrez html-to-pdf et chargez le fichier enregistré. 3. Choisissez le format de page : A4 ou Letter. 4. Laissez les graphismes d'arrière-plan actifs si la mise en forme compte. 5. Lancez le traitement et comparez le résultat à la page d'origine.

Faites l'étape cinq immédiatement et non un mois plus tard : si quelque chose a disparu, la page est encore accessible et peut être enregistrée autrement.

Les graphismes d'arrière-plan et pourquoi les laisser actifs

L'interrupteur des graphismes d'arrière-plan détermine si les aplats, les images de fond et les panneaux colorés atteignent le PDF.

Il est actif par défaut, ce qui est juste pour une archive : désactivé, il transforme du texte sur panneau coloré en texte sur blanc, et une partie du sens de la mise en forme se perd. Cela se voit surtout sur les avertissements signalés par la couleur et sur les tableaux à lignes alternées.

Il existe exactement une raison de le désactiver : la page part à l'impression et les aplats mangeraient du toner. Pour une archive, laissez-le.

Format de page et tableaux larges

Le format de page vaut A4 par défaut. Le choix se limite ici à A4 et Letter ; il n'y a pas de format libre.

Il en découle un problème incontournable. Une page web n'a pas de largeur : elle s'adapte à la fenêtre. Un PDF en a une, fixe. Un tableau large qui défilait latéralement dans le navigateur se retrouve rogné au bord de la feuille.

Impossible de contourner cela dans l'outil. On le contourne à l'extérieur : réduisez le zoom de la page dans le navigateur avant d'enregistrer, et le tableau tiendra dans la largeur.

Quand le HTML devient du texte brut

Il existe une voie rapide automatique. Les fichiers HTML très volumineux ne contenant ni images, ni tableaux, ni styles incorporés, ni médias sont rendus en texte brut, sans mise en page.

C'est une décision délibérée : rendre intégralement une page de plusieurs mégaoctets de texte pur coûte cher et donne la même chose.

Cela ne se passe pas en silence. Le résultat porte un avertissement indiquant que le document a été assemblé de façon simplifiée et que la mise en forme n'a pas été conservée. Si ce résultat ne vous convient pas, le fichier est tombé dans l'heuristique par erreur, et la page mérite d'être réenregistrée de manière à conserver son balisage.

Que faire de l'archive terminée

Trois gestes à faire tout de suite.

Vérifiez le poids. Une page riche en images donne un PDF lourd, et compress-pdf le réduira sans toucher au texte.

Remplissez les propriétés du document. Dans un PDF issu de HTML, le champ du titre est d'ordinaire vide ou porte une chaîne technique. Un titre parlant et une date via set-pdf-metadata facilitent grandement la recherche dans l'archive un an après.

Si plusieurs pages forment un même document, assemblez-les avec merge-pdf dans l'ordre de lecture et non dans celui de l'enregistrement.

Et enfin. Pour une conservation longue, il vaut la peine de passer le résultat par pdf-to-pdfa : le profil d'archivage exige que tout le nécessaire à l'affichage vive à l'intérieur du fichier, ce qui est exactement ce qu'une archive demande.

FAQ

Non, l'outil travaille à partir d'un fichier. Enregistrez la page dans votre navigateur au format HTML et chargez le résultat. L'option d'enregistrement qui emballe toute la page dans un seul fichier fonctionne le mieux.
La page est dessinée en isolation : les accès aux fichiers locaux sont bloqués, et parmi les adresses externes seules celles visibles dans le HTML lors d'une analyse statique sont autorisées. Les images qu'un script charge après l'ouverture n'atteignent jamais le moteur de rendu.
C'est la voie rapide automatique : les fichiers HTML très volumineux sans images, tableaux, styles incorporés ni médias sont rendus en texte. Le résultat porte un avertissement indiquant que la mise en forme n'a pas été conservée.
Non, le parcours de base fonctionne sans inscription.
Les fichiers ne servent qu'à l'opération choisie et sont supprimés automatiquement une fois le traitement terminé. Nous n'utilisons pas les documents chargés pour entraîner des modèles d'IA.

Plus de ce cluster

Outils associés

← Tous les outils Convertir

Que faire ensuite

Si vous avez besoin d'une étape pratique ou d'un repère sur le service après la lecture, ouvrez ces pages.

Tous les outils

Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.

FAQ

Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.

Contact

Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.