HTML en PDF : sauver une page web
En bref : La page est dessinée par un navigateur sans interface à partir du fichier HTML que vous chargez. Les chemins locaux ne sont pas sollicités du tout, et les adresses externes seulement si elles figurent dans le HTML lui-même. Une archive fiable vient d'un fichier unique et autonome où tout est incorporé.
Cluster
sécurité
Flux de protection, de contrôle d’accès, de masquage et de partage contrôlé.
Outil principal
HTML en PDF en ligne
Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.
Ouvrir l'outilTable des matières
- L'outil accepte un fichier, pas une adresse de page
- Pourquoi les images disparaissent
- Tout ce qui apparaît après le chargement n'atteint pas le PDF
- En quoi une archive PDF diffère d'une capture et d'un signet
- Comment procéder à l'enregistrement
- Les graphismes d'arrière-plan et pourquoi les laisser actifs
- Format de page et tableaux larges
- Quand le HTML devient du texte brut
- Que faire de l'archive terminée
Enregistrer une page web en PDF : ce qui atteint l'archive et ce qui n'y arrive pas
Il faut conserver une page de sorte que dans un an elle s'ouvre et ressemble à ce qu'elle est aujourd'hui : des conditions générales, une page de tarifs, un article que quelqu'un pourrait modifier. Le PDF convient mieux qu'une capture, parce que le texte survit, et mieux qu'un signet, parce qu'il ne dépend pas du serveur d'autrui.
Mais entre « page dans le navigateur » et « page en PDF » il y a quelques étapes où du contenu se perd. Voyons lesquelles.
L'outil accepte un fichier, pas une adresse de page
Première chose à comprendre : on n'y saisit pas l'adresse d'un site. On charge un fichier HTML enregistré.
Votre navigateur sait enregistrer la page. La boîte de dialogue propose en général de choisir entre HTML seul et une option qui emballe la page entière. La seconde est nettement meilleure : elle réunit balisage, styles et images dans un fichier, et c'est ce dont une archive a besoin.
Pourquoi c'est ainsi, la section suivante l'explique, et cette même explication couvre la plupart des résultats surprenants.
Pourquoi les images disparaissent
La page est dessinée dans un navigateur isolé, et le contenu lui est remis directement plutôt qu'ouvert depuis un chemin de fichier. Une telle page n'a pas d'emplacement sur le disque d'où lire des fichiers voisins.
D'où une règle stricte : les références à des fichiers locaux ne fonctionnent pas. Si un dossier `page_files` plein d'images se trouve à côté de votre `page.html`, aucune n'atteint le PDF. Le navigateur ne peut tout simplement pas y accéder.
Les adresses externes fonctionnent, mais pas n'importe lesquelles. Avant le rendu, le HTML est analysé statiquement, une liste d'adresses en est tirée, et seules celles-là sont récupérées. Une ressource dont le balisage ne dit rien est bloquée, et une redirection vers une autre adresse également.
Il en découle une conclusion pratique : une archive fiable vient d'un fichier autonome, où images et styles sont incorporés au balisage plutôt que posés à côté.
Tout ce qui apparaît après le chargement n'atteint pas le PDF
La deuxième source de pertes, c'est la dynamique.
Une page moderne charge souvent du contenu après son ouverture : images au défilement, commentaires au clic, tableau de données en requête séparée. Le rendu travaille sur le balisage et non sur la page vivante, et ce qui se charge plus tard n'y figure pas.
Pour la même raison, les blocs repliés restent repliés, les onglets autres que l'actif manquent, et tout ce qui s'affiche au survol est absent.
Vous pouvez le vérifier à l'avance : désactivez les scripts dans le navigateur et rechargez la page. Ce qui reste visible atteindra le PDF. Ce qui disparaît, non.
En quoi une archive PDF diffère d'une capture et d'un signet
Trois façons de conserver une page résolvent des problèmes différents, et les confondre coûte cher.
| Méthode | Ce qui est conservé | Ce qui manque |
|---|---|---|
| Signet | Rien sinon l'adresse | La page peut changer ou disparaître |
| Capture | Une image de la zone visible | Le texte ne se cherche ni ne se copie, une longue page ne tient pas |
| Texte, mise en forme, toutes les pages entières | L'interactivité et ce que chargent les scripts |
Pour une tâche probatoire, c'est la troisième colonne de la deuxième ligne qui compte. Une capture d'une page de tarifs ne permet pas de retrouver une clause par recherche et ne montre pas ce qui figurait plus bas. Le PDF fait les deux.
À retenir séparément : aucune des trois n'est une preuve juridique du contenu d'une page à une date. Le constat notarié existe pour cela, et il fonctionne autrement.
Comment procéder à l'enregistrement
1. Ouvrez la page dans un navigateur et enregistrez-la en HTML, en choisissant l'option fichier unique. 2. Ouvrez html-to-pdf et chargez le fichier enregistré. 3. Choisissez le format de page : A4 ou Letter. 4. Laissez les graphismes d'arrière-plan actifs si la mise en forme compte. 5. Lancez le traitement et comparez le résultat à la page d'origine.
Faites l'étape cinq immédiatement et non un mois plus tard : si quelque chose a disparu, la page est encore accessible et peut être enregistrée autrement.
Les graphismes d'arrière-plan et pourquoi les laisser actifs
L'interrupteur des graphismes d'arrière-plan détermine si les aplats, les images de fond et les panneaux colorés atteignent le PDF.
Il est actif par défaut, ce qui est juste pour une archive : désactivé, il transforme du texte sur panneau coloré en texte sur blanc, et une partie du sens de la mise en forme se perd. Cela se voit surtout sur les avertissements signalés par la couleur et sur les tableaux à lignes alternées.
Il existe exactement une raison de le désactiver : la page part à l'impression et les aplats mangeraient du toner. Pour une archive, laissez-le.
Format de page et tableaux larges
Le format de page vaut A4 par défaut. Le choix se limite ici à A4 et Letter ; il n'y a pas de format libre.
Il en découle un problème incontournable. Une page web n'a pas de largeur : elle s'adapte à la fenêtre. Un PDF en a une, fixe. Un tableau large qui défilait latéralement dans le navigateur se retrouve rogné au bord de la feuille.
Impossible de contourner cela dans l'outil. On le contourne à l'extérieur : réduisez le zoom de la page dans le navigateur avant d'enregistrer, et le tableau tiendra dans la largeur.
Quand le HTML devient du texte brut
Il existe une voie rapide automatique. Les fichiers HTML très volumineux ne contenant ni images, ni tableaux, ni styles incorporés, ni médias sont rendus en texte brut, sans mise en page.
C'est une décision délibérée : rendre intégralement une page de plusieurs mégaoctets de texte pur coûte cher et donne la même chose.
Cela ne se passe pas en silence. Le résultat porte un avertissement indiquant que le document a été assemblé de façon simplifiée et que la mise en forme n'a pas été conservée. Si ce résultat ne vous convient pas, le fichier est tombé dans l'heuristique par erreur, et la page mérite d'être réenregistrée de manière à conserver son balisage.
Que faire de l'archive terminée
Trois gestes à faire tout de suite.
Vérifiez le poids. Une page riche en images donne un PDF lourd, et compress-pdf le réduira sans toucher au texte.
Remplissez les propriétés du document. Dans un PDF issu de HTML, le champ du titre est d'ordinaire vide ou porte une chaîne technique. Un titre parlant et une date via set-pdf-metadata facilitent grandement la recherche dans l'archive un an après.
Si plusieurs pages forment un même document, assemblez-les avec merge-pdf dans l'ordre de lecture et non dans celui de l'enregistrement.
Et enfin. Pour une conservation longue, il vaut la peine de passer le résultat par pdf-to-pdfa : le profil d'archivage exige que tout le nécessaire à l'affichage vive à l'intérieur du fichier, ce qui est exactement ce qu'une archive demande.
FAQ
Plus de ce cluster
sécurité
Protéger un PDF par mot de passe
Protéger un PDF par mot de passe avant de l'envoyer : les deux mots de passe, ce que les profils autorisent vraiment et où passe la limite.
sécurité
Enlever le mot de passe d'un PDF
Un PDF porte deux mécanismes de protection et un seul est réel. Ce qu'apporte le chiffrement, pourquoi une interdiction de copie est une prière, et pourquoi un champ de mot de passe vide règle parfois l'affaire.
sécurité
Masquer les données sensibles d'un PDF
Un rectangle noir posé sur le texte n'efface rien. Ce qui distingue vraiment les styles de caviardage, pourquoi le flou ne vaut pas suppression, et ce qu'il advient des métadonnées.
Outils associés
HTML en PDF en ligne
Convertissez une page HTML en PDF pour enregistrer son contenu comme document à archiver ou à envoyer.
Compresser PDF en ligne
Réduisez la taille d'un PDF pour l'envoyer, le téléverser ou le stocker plus facilement. Particulièrement utile pour les scans et documents avec images.
Fusionner PDF en ligne
Fusionnez plusieurs PDF en un seul fichier : un contrat avec ses annexes, un lot de scans d'une pièce d'identité ou les sections d'un rapport, plus simples à envoyer en une seule pièce jointe qu'en dix e-mails séparés.
PDF en PDF/A en ligne
Convertissez un PDF classique en PDF/A, un format conçu pour un stockage fiable à long terme.
Que faire ensuite
Tous les outils
Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.
FAQ
Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.
Contact
Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.