HTML zu PDF: Webseite sichern
Kurz gesagt: Die Seite zeichnet ein Browser ohne Oberfläche aus der HTML-Datei, die Sie hochladen. Lokale Pfade werden gar nicht abgerufen, externe nur für die Adressen, die im HTML selbst stehen. Ein verlässliches Archiv entsteht aus einer einzigen, in sich geschlossenen Datei mit allem eingebettet.
Cluster
Sicherheit
Schutz, Zugriffskontrolle, Schwärzen und kontrollierte Weitergabe.
Primäres Tool
HTML in PDF online
Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.
Tool öffnenInhaltsverzeichnis
- Das Werkzeug nimmt eine Datei, keine Seitenadresse
- Warum Bilder verschwinden
- Alles, was erst nach dem Laden erscheint, erreicht die PDF nicht
- Worin sich ein PDF-Archiv von einem Bildschirmfoto und einem Lesezeichen unterscheidet
- Wie Sie die Sicherung vornehmen
- Hintergrundgrafik und warum sie anbleiben sollte
- Seitengröße und breite Tabellen
- Wann aus HTML reiner Text wird
- Was mit dem fertigen Archiv zu tun ist
Eine Webseite als PDF sichern: was ins Archiv gelangt und was nicht
Eine Seite soll so aufbewahrt werden, dass sie in einem Jahr noch aufgeht und aussieht wie heute: Nutzungsbedingungen, eine Tarifseite, ein Beitrag, den jemand bearbeiten könnte. PDF eignet sich dafür besser als ein Bildschirmfoto, weil der Text überlebt, und besser als ein Lesezeichen, weil es nicht vom fremden Server abhängt.
Doch zwischen „Seite im Browser“ und „Seite als PDF“ liegen einige Schritte, an denen Inhalt verlorengeht. Sehen wir, wo.
Das Werkzeug nimmt eine Datei, keine Seitenadresse
Das Erste zum Verständnis: hier tippt man keine Webadresse ein. Man lädt eine gespeicherte HTML-Datei hoch.
Ihr Browser kann die Seite speichern. Der Speicherdialog bietet meist die Wahl zwischen „nur HTML“ und einer Option, die die ganze Seite packt. Die zweite ist spürbar besser: sie sammelt Auszeichnung, Stile und Bilder in einer Datei, und genau das braucht ein Archiv.
Warum das so gebaut ist, erklärt der nächste Abschnitt, und dieselbe Erklärung deckt die meisten überraschenden Ergebnisse ab.
Warum Bilder verschwinden
Die Seite wird in einem abgeschotteten Browser gezeichnet, und der Inhalt wird ihm direkt übergeben, statt über einen Dateipfad geöffnet zu werden. So eine Seite hat keinen Ort auf der Platte, von dem sie Nachbardateien lesen könnte.
Daraus folgt eine harte Regel: Verweise auf lokale Dateien funktionieren nicht. Liegt neben Ihrer `page.html` ein Ordner `page_files` voller Bilder, erreicht keines davon die PDF. Der Browser kommt schlicht nicht daran.
Externe Adressen funktionieren, aber nicht beliebige. Vor dem Zeichnen wird das HTML statisch untersucht, daraus eine Adressliste gebaut, und nur diese werden geholt. Eine Ressource, von der die Auszeichnung nichts sagt, wird blockiert, und eine Weiterleitung auf eine andere Adresse ebenso.
Es gibt einen praktischen Schluss: ein verlässliches Archiv entsteht aus einer in sich geschlossenen Datei, in der Bilder und Stile in der Auszeichnung stecken statt danebenzuliegen.
Alles, was erst nach dem Laden erscheint, erreicht die PDF nicht
Die zweite Verlustquelle ist die Dynamik.
Eine moderne Seite holt Inhalt oft erst nach dem Öffnen: Bilder beim Scrollen, Kommentare auf Klick, eine Datentabelle als eigene Anfrage. Das Zeichnen arbeitet an der Auszeichnung, nicht an der lebenden Seite, und was später lädt, steht nicht darin.
Aus demselben Grund bleiben eingeklappte Blöcke eingeklappt, andere Reiter als der aktive fehlen, und alles, was beim Überfahren erscheint, ist nicht dabei.
Sie können das vorher prüfen: schalten Sie im Browser die Skripte ab und laden Sie die Seite neu. Was sichtbar bleibt, erreicht die PDF. Was verschwindet, nicht.
Worin sich ein PDF-Archiv von einem Bildschirmfoto und einem Lesezeichen unterscheidet
Drei Wege, eine Seite zu sichern, lösen verschiedene Aufgaben, und sie zu verwechseln ist teuer.
| Weg | Was bewahrt wird | Was fehlt |
|---|---|---|
| Lesezeichen | Nichts außer der Adresse | Die Seite kann sich ändern oder verschwinden |
| Bildschirmfoto | Ein Bild des sichtbaren Bereichs | Text ist nicht durchsuchbar und nicht kopierbar, eine lange Seite passt nicht |
| Text, Gestaltung, alle Seiten vollständig | Interaktivität und alles, was Skripte nachladen |
Für eine Beweisaufgabe zählt die dritte Spalte der zweiten Zeile. Ein Bildschirmfoto einer Tarifseite erlaubt keine Suche nach einer Klausel und zeigt nicht, was unterhalb des sichtbaren Bereichs stand. Eine PDF kann beides.
Getrennt zu merken: keiner der drei Wege ist ein rechtlicher Nachweis des Seiteninhalts zu einem Datum. Dafür gibt es die notarielle Beurkundung, und die funktioniert anders.
Wie Sie die Sicherung vornehmen
1. Öffnen Sie die Seite im Browser und speichern Sie sie als HTML mit der Ein-Datei-Option. 2. Öffnen Sie html-to-pdf und laden Sie die gespeicherte Datei hoch. 3. Wählen Sie die Seitengröße: A4 oder Letter. 4. Lassen Sie die Hintergrundgrafik an, wenn die Gestaltung zählt. 5. Starten Sie den Auftrag und vergleichen Sie das Ergebnis mit der Ausgangsseite.
Schritt fünf sofort erledigen, nicht einen Monat später: ist etwas verlorengegangen, ist die Seite noch verfügbar und lässt sich anders speichern.
Hintergrundgrafik und warum sie anbleiben sollte
Der Schalter für Hintergrundgrafik steuert, ob Füllungen, Hintergrundbilder und farbige Flächen in die PDF gelangen.
Er ist voreingestellt an, und für ein Archiv ist das richtig: abgeschaltet macht er aus Text auf farbiger Fläche Text auf Weiß, und ein Teil der gestalterischen Aussage geht verloren. Am deutlichsten zeigt sich das bei farblich markierten Warnhinweisen und bei Tabellen mit wechselnden Zeilenfarben.
Es gibt genau einen Grund, ihn abzuschalten: die Seite geht in den Druck und die Füllungen würden Toner fressen. Fürs Archiv lassen Sie ihn an.
Seitengröße und breite Tabellen
Die Seitengröße steht auf A4. Die Wahl besteht hier nur zwischen A4 und Letter; ein freies Format gibt es nicht.
Daraus folgt ein unlösbares Problem. Eine Webseite hat keine Breite: sie passt sich dem Fenster an. Eine PDF hat eine feste. Eine breite Tabelle, die im Browser seitlich scrollte, wird an der Blattkante abgeschnitten.
Im Werkzeug lässt sich das nicht umgehen. Man umgeht es außerhalb: verkleinern Sie vor dem Speichern die Seitenskalierung im Browser, dann passt die Tabelle in die Breite.
Wann aus HTML reiner Text wird
Es gibt einen automatischen Schnellweg. Sehr große HTML-Dateien ohne Bilder, ohne Tabellen, ohne eingebettete Stile und ohne Medien werden als reiner Text gezeichnet, ohne Layout.
Das ist eine bewusste Entscheidung: eine mehrere Megabyte große Seite reinen Textes vollständig zu zeichnen kostet viel und bringt dasselbe.
Es geschieht nicht stumm. Dem Ergebnis liegt eine Warnung bei, dass das Dokument vereinfacht zusammengesetzt wurde und die Gestaltung nicht erhalten blieb. Passt Ihnen dieses Ergebnis nicht, ist die Datei irrtümlich in die Heuristik geraten, und die Seite sollte so neu gespeichert werden, dass ihre Auszeichnung erhalten bleibt.
Was mit dem fertigen Archiv zu tun ist
Drei Schritte, die sich sofort lohnen.
Prüfen Sie das Gewicht. Eine bilderreiche Seite ergibt eine schwere PDF, und compress-pdf verkleinert sie, ohne den Text anzurühren.
Füllen Sie die Dokumenteigenschaften. In einer aus HTML erzeugten PDF ist das Titelfeld meist leer oder enthält eine technische Zeichenkette. Ein sinnvoller Titel und ein Datum über set-pdf-metadata erleichtern die Suche im Archiv ein Jahr später erheblich.
Bilden mehrere Seiten ein Dokument, fügen Sie sie mit merge-pdf in Lesereihenfolge zusammen, nicht in der Reihenfolge des Speicherns.
Und zuletzt. Für lange Aufbewahrung lohnt ein Durchgang durch pdf-to-pdfa: das Archivprofil verlangt, dass alles zur Darstellung Nötige in der Datei selbst liegt, und genau das will ein Archiv.
Häufige Fragen
Mehr aus diesem Cluster
Sicherheit
PDF mit Passwort schützen vor dem Versenden
Wie Sie ein PDF vor dem Versand per E-Mail mit einem Passwort schützen, wie es Schritt für Schritt geht und worauf Sie achten, um sich nicht selbst auszusperren.
Sicherheit
Passwort aus geschütztem PDF entfernen
Eine PDF trägt zwei Schutzmechanismen, und nur einer davon ist echt. Was die Verschlüsselung leistet, warum ein Kopierverbot eine Bitte ist, und warum ein leeres Passwortfeld die Aufgabe manchmal erledigt.
Sicherheit
Vertrauliche Daten im PDF schwärzen
Ein über den Text gelegtes schwarzes Rechteck löscht nichts. Worin sich die Schwärzungsstile inhaltlich unterscheiden, warum Weichzeichnen nicht als Entfernen zählt und was mit den Metadaten geschieht.
Verwandte Tools
HTML in PDF online
Wandeln Sie eine HTML-Seite in PDF um, um ihren Inhalt als Dokument zu archivieren oder zu senden.
PDF komprimieren online
Reduzieren Sie die Größe einer PDF-Datei, damit sie sich leichter senden, hochladen oder speichern lässt. Besonders hilfreich bei Scans und Dokumenten mit Bildern.
PDF zusammenführen online
Führen Sie mehrere PDFs zu einer Datei zusammen: einen Vertrag mit Anlagen, einen Stapel gescannter Ausweise oder Berichtskapitel, die sich als ein Anhang leichter versenden lassen als in zehn einzelnen E-Mails.
PDF in PDF/A online
Wandeln Sie eine normale PDF in PDF/A um, ein Format für zuverlässige Langzeitspeicherung von Dokumenten.
Was als Nächstes sinnvoll ist
Alle Tools
PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.
FAQ
Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.
Kontakt
Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.