Zum Inhalt springen
Artikel

HTML zu PDF: Webseite sichern

Das Werkzeug nimmt eine gespeicherte HTML-Datei statt einer Seitenadresse und zeichnet sie in einem abgeschotteten Browser. Daher die Regeln: lokale Bilder werden nicht geladen, und alles, was erst nach dem Laden erscheint, erreicht die PDF nie.

Kurz gesagt: Die Seite zeichnet ein Browser ohne Oberfläche aus der HTML-Datei, die Sie hochladen. Lokale Pfade werden gar nicht abgerufen, externe nur für die Adressen, die im HTML selbst stehen. Ein verlässliches Archiv entsteht aus einer einzigen, in sich geschlossenen Datei mit allem eingebettet.

Cluster

Sicherheit

Schutz, Zugriffskontrolle, Schwärzen und kontrollierte Weitergabe.

4 Artikel

Primäres Tool

HTML in PDF online

Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.

Tool öffnen

Inhaltsverzeichnis

Eine Webseite als PDF sichern: was ins Archiv gelangt und was nicht

Eine Seite soll so aufbewahrt werden, dass sie in einem Jahr noch aufgeht und aussieht wie heute: Nutzungsbedingungen, eine Tarifseite, ein Beitrag, den jemand bearbeiten könnte. PDF eignet sich dafür besser als ein Bildschirmfoto, weil der Text überlebt, und besser als ein Lesezeichen, weil es nicht vom fremden Server abhängt.

Doch zwischen „Seite im Browser“ und „Seite als PDF“ liegen einige Schritte, an denen Inhalt verlorengeht. Sehen wir, wo.

Das Werkzeug nimmt eine Datei, keine Seitenadresse

Das Erste zum Verständnis: hier tippt man keine Webadresse ein. Man lädt eine gespeicherte HTML-Datei hoch.

Ihr Browser kann die Seite speichern. Der Speicherdialog bietet meist die Wahl zwischen „nur HTML“ und einer Option, die die ganze Seite packt. Die zweite ist spürbar besser: sie sammelt Auszeichnung, Stile und Bilder in einer Datei, und genau das braucht ein Archiv.

Warum das so gebaut ist, erklärt der nächste Abschnitt, und dieselbe Erklärung deckt die meisten überraschenden Ergebnisse ab.

Warum Bilder verschwinden

Die Seite wird in einem abgeschotteten Browser gezeichnet, und der Inhalt wird ihm direkt übergeben, statt über einen Dateipfad geöffnet zu werden. So eine Seite hat keinen Ort auf der Platte, von dem sie Nachbardateien lesen könnte.

Daraus folgt eine harte Regel: Verweise auf lokale Dateien funktionieren nicht. Liegt neben Ihrer `page.html` ein Ordner `page_files` voller Bilder, erreicht keines davon die PDF. Der Browser kommt schlicht nicht daran.

Externe Adressen funktionieren, aber nicht beliebige. Vor dem Zeichnen wird das HTML statisch untersucht, daraus eine Adressliste gebaut, und nur diese werden geholt. Eine Ressource, von der die Auszeichnung nichts sagt, wird blockiert, und eine Weiterleitung auf eine andere Adresse ebenso.

Es gibt einen praktischen Schluss: ein verlässliches Archiv entsteht aus einer in sich geschlossenen Datei, in der Bilder und Stile in der Auszeichnung stecken statt danebenzuliegen.

Alles, was erst nach dem Laden erscheint, erreicht die PDF nicht

Die zweite Verlustquelle ist die Dynamik.

Eine moderne Seite holt Inhalt oft erst nach dem Öffnen: Bilder beim Scrollen, Kommentare auf Klick, eine Datentabelle als eigene Anfrage. Das Zeichnen arbeitet an der Auszeichnung, nicht an der lebenden Seite, und was später lädt, steht nicht darin.

Aus demselben Grund bleiben eingeklappte Blöcke eingeklappt, andere Reiter als der aktive fehlen, und alles, was beim Überfahren erscheint, ist nicht dabei.

Sie können das vorher prüfen: schalten Sie im Browser die Skripte ab und laden Sie die Seite neu. Was sichtbar bleibt, erreicht die PDF. Was verschwindet, nicht.

Worin sich ein PDF-Archiv von einem Bildschirmfoto und einem Lesezeichen unterscheidet

Drei Wege, eine Seite zu sichern, lösen verschiedene Aufgaben, und sie zu verwechseln ist teuer.

WegWas bewahrt wirdWas fehlt
LesezeichenNichts außer der AdresseDie Seite kann sich ändern oder verschwinden
BildschirmfotoEin Bild des sichtbaren BereichsText ist nicht durchsuchbar und nicht kopierbar, eine lange Seite passt nicht
PDFText, Gestaltung, alle Seiten vollständigInteraktivität und alles, was Skripte nachladen

Für eine Beweisaufgabe zählt die dritte Spalte der zweiten Zeile. Ein Bildschirmfoto einer Tarifseite erlaubt keine Suche nach einer Klausel und zeigt nicht, was unterhalb des sichtbaren Bereichs stand. Eine PDF kann beides.

Getrennt zu merken: keiner der drei Wege ist ein rechtlicher Nachweis des Seiteninhalts zu einem Datum. Dafür gibt es die notarielle Beurkundung, und die funktioniert anders.

Wie Sie die Sicherung vornehmen

1. Öffnen Sie die Seite im Browser und speichern Sie sie als HTML mit der Ein-Datei-Option. 2. Öffnen Sie html-to-pdf und laden Sie die gespeicherte Datei hoch. 3. Wählen Sie die Seitengröße: A4 oder Letter. 4. Lassen Sie die Hintergrundgrafik an, wenn die Gestaltung zählt. 5. Starten Sie den Auftrag und vergleichen Sie das Ergebnis mit der Ausgangsseite.

Schritt fünf sofort erledigen, nicht einen Monat später: ist etwas verlorengegangen, ist die Seite noch verfügbar und lässt sich anders speichern.

Hintergrundgrafik und warum sie anbleiben sollte

Der Schalter für Hintergrundgrafik steuert, ob Füllungen, Hintergrundbilder und farbige Flächen in die PDF gelangen.

Er ist voreingestellt an, und für ein Archiv ist das richtig: abgeschaltet macht er aus Text auf farbiger Fläche Text auf Weiß, und ein Teil der gestalterischen Aussage geht verloren. Am deutlichsten zeigt sich das bei farblich markierten Warnhinweisen und bei Tabellen mit wechselnden Zeilenfarben.

Es gibt genau einen Grund, ihn abzuschalten: die Seite geht in den Druck und die Füllungen würden Toner fressen. Fürs Archiv lassen Sie ihn an.

Seitengröße und breite Tabellen

Die Seitengröße steht auf A4. Die Wahl besteht hier nur zwischen A4 und Letter; ein freies Format gibt es nicht.

Daraus folgt ein unlösbares Problem. Eine Webseite hat keine Breite: sie passt sich dem Fenster an. Eine PDF hat eine feste. Eine breite Tabelle, die im Browser seitlich scrollte, wird an der Blattkante abgeschnitten.

Im Werkzeug lässt sich das nicht umgehen. Man umgeht es außerhalb: verkleinern Sie vor dem Speichern die Seitenskalierung im Browser, dann passt die Tabelle in die Breite.

Wann aus HTML reiner Text wird

Es gibt einen automatischen Schnellweg. Sehr große HTML-Dateien ohne Bilder, ohne Tabellen, ohne eingebettete Stile und ohne Medien werden als reiner Text gezeichnet, ohne Layout.

Das ist eine bewusste Entscheidung: eine mehrere Megabyte große Seite reinen Textes vollständig zu zeichnen kostet viel und bringt dasselbe.

Es geschieht nicht stumm. Dem Ergebnis liegt eine Warnung bei, dass das Dokument vereinfacht zusammengesetzt wurde und die Gestaltung nicht erhalten blieb. Passt Ihnen dieses Ergebnis nicht, ist die Datei irrtümlich in die Heuristik geraten, und die Seite sollte so neu gespeichert werden, dass ihre Auszeichnung erhalten bleibt.

Was mit dem fertigen Archiv zu tun ist

Drei Schritte, die sich sofort lohnen.

Prüfen Sie das Gewicht. Eine bilderreiche Seite ergibt eine schwere PDF, und compress-pdf verkleinert sie, ohne den Text anzurühren.

Füllen Sie die Dokumenteigenschaften. In einer aus HTML erzeugten PDF ist das Titelfeld meist leer oder enthält eine technische Zeichenkette. Ein sinnvoller Titel und ein Datum über set-pdf-metadata erleichtern die Suche im Archiv ein Jahr später erheblich.

Bilden mehrere Seiten ein Dokument, fügen Sie sie mit merge-pdf in Lesereihenfolge zusammen, nicht in der Reihenfolge des Speicherns.

Und zuletzt. Für lange Aufbewahrung lohnt ein Durchgang durch pdf-to-pdfa: das Archivprofil verlangt, dass alles zur Darstellung Nötige in der Datei selbst liegt, und genau das will ein Archiv.

Häufige Fragen

Nein, das Werkzeug arbeitet mit einer Datei. Speichern Sie die Seite im Browser als HTML und laden Sie das Ergebnis hoch. Die Speicheroption, die die ganze Seite in eine einzige Datei packt, funktioniert am besten.
Die Seite wird abgeschottet gezeichnet: Zugriffe auf lokale Dateien werden blockiert, und von externen Adressen sind nur die erlaubt, die bei einer statischen Prüfung im HTML sichtbar sind. Bilder, die ein Skript nach dem Öffnen nachlädt, erreichen den Renderer nie.
Das ist der automatische Schnellweg: sehr große HTML-Dateien ohne Bilder, Tabellen, eingebettete Stile und Medien werden als Text gezeichnet. Dem Ergebnis liegt eine Warnung bei, dass die Formatierung nicht erhalten blieb.
Nein, der Grundablauf funktioniert ohne Registrierung.
Dateien werden nur für den gewählten Vorgang verwendet und nach Abschluss der Verarbeitung automatisch gelöscht. Wir nutzen hochgeladene Dokumente nicht zum Training von KI-Modellen.

Mehr aus diesem Cluster

Verwandte Tools

← Alle Tools: Konvertieren

Was als Nächstes sinnvoll ist

Wenn Sie nach dem Lesen den nächsten praktischen Schritt oder mehr Orientierung zum Dienst brauchen, öffnen Sie diese Seiten.

Alle Tools

PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.

FAQ

Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.

Kontakt

Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.