Saltar al contenido
Artículo

HTML a PDF: guardar una web

La herramienta acepta un archivo HTML guardado y no una dirección, y lo dibuja en un navegador aislado. De ahí las reglas: las imágenes locales no se cargan y todo lo que aparece después de la carga no llega al PDF.

En resumen: La página la dibuja un navegador sin interfaz a partir del archivo HTML que usted sube. Las rutas locales no se piden en absoluto, y las externas solo si figuran en el propio HTML. Un archivo fiable sale de un único fichero autosuficiente con todo incrustado dentro.

Cluster

seguridad

Flujos de protección, control de acceso, redacción y compartición controlada.

4 artículos

Herramienta principal

HTML a PDF en línea

Abre la herramienta de este artículo y completa la operación en la localización actual.

Abrir herramienta

Tabla de contenidos

Guardar una página web en PDF: qué llega al archivo y qué no

Hay que conservar una página de modo que dentro de un año se abra y se vea como hoy: unas condiciones de servicio, una página de tarifas, un artículo que alguien podría editar. El PDF sirve mejor que una captura, porque el texto sobrevive, y mejor que un marcador, porque no depende del servidor ajeno.

Pero entre «página en el navegador» y «página en PDF» hay unos cuantos pasos donde se pierde contenido. Veamos dónde.

La herramienta acepta un archivo, no una dirección

Lo primero que conviene entender: aquí no se escribe la dirección de un sitio. Se sube un archivo HTML guardado.

Su navegador sabe guardar la página. El diálogo de guardado suele ofrecer elegir entre solo HTML y una opción que empaqueta la página completa. La segunda es bastante mejor: reúne marcado, estilos e imágenes en un fichero, y eso es lo que un archivo necesita.

Por qué está hecho así lo explica el apartado siguiente, y esa misma explicación cubre la mayoría de los resultados sorprendentes.

Por qué desaparecen las imágenes

La página se dibuja en un navegador aislado, y el contenido se le entrega directamente en lugar de abrirse desde una ruta de archivo. Una página así no tiene ubicación en disco desde la que leer ficheros vecinos.

De ahí una regla dura: las referencias a archivos locales no funcionan. Si junto a su `page.html` hay una carpeta `page_files` llena de imágenes, ninguna llega al PDF. El navegador sencillamente no puede alcanzarlas.

Las direcciones externas sí funcionan, pero no todas. Antes de dibujar, el HTML se analiza estáticamente, se construye una lista de direcciones y solo esas se descargan. Un recurso del que el marcado no dice nada queda bloqueado, y una redirección a otra dirección también.

Hay una conclusión práctica: un archivo fiable sale de un fichero autosuficiente, donde imágenes y estilos van incrustados en el marcado y no al lado.

Todo lo que aparece tras la carga no llega al PDF

La segunda fuente de pérdidas es la dinámica.

Una página moderna suele traer contenido después de abrirse: imágenes al desplazarse, comentarios al pulsar, una tabla de datos como petición aparte. El dibujado trabaja con el marcado y no con la página viva, y lo que se carga más tarde no está allí.

Por lo mismo, los bloques plegados siguen plegados, las pestañas distintas de la activa faltan y todo lo que se muestra al pasar el ratón no aparece.

Puede comprobarlo de antemano: desactive los scripts en el navegador y recargue la página. Lo que siga visible llegará al PDF. Lo que se esfume, no.

En qué se diferencia un archivo PDF de una captura y de un marcador

Tres maneras de conservar una página resuelven problemas distintos, y confundirlas sale caro.

MétodoQué se conservaQué falta
MarcadorNada salvo la direcciónLa página puede cambiar o desaparecer
CapturaUna imagen del área visibleEl texto no se busca ni se copia, una página larga no cabe
PDFTexto, formato, todas las páginas enterasInteractividad y lo que cargan los scripts

Para una tarea probatoria importa la tercera columna de la segunda fila. Una captura de una página de tarifas no permite encontrar una cláusula por búsqueda ni muestra lo que había más abajo. El PDF hace ambas cosas.

Conviene recordar aparte que ninguno de los tres es prueba jurídica del contenido de una página en una fecha. Para eso existe el acta notarial, y funciona de otro modo.

Cómo hacer el guardado

1. Abra la página en el navegador y guárdela como HTML, eligiendo la opción de fichero único. 2. Abra html-to-pdf y suba el archivo guardado. 3. Elija el tamaño de página: A4 o Letter. 4. Deje activada la gráfica de fondo si el diseño importa. 5. Ejecute la tarea y compare el resultado con la página original.

Haga el paso cinco de inmediato y no un mes después: si algo se perdió, la página sigue disponible y puede guardarse de otra forma.

La gráfica de fondo y por qué dejarla activada

El interruptor de gráfica de fondo controla si los rellenos, las imágenes de fondo y los paneles de color llegan al PDF.

Viene activado, y para un archivo eso es lo correcto: apagado, convierte el texto sobre un panel de color en texto sobre blanco, y parte del sentido del diseño se pierde. Se nota sobre todo en advertencias marcadas por color y en tablas de filas alternas.

Hay exactamente un motivo para apagarlo: la página va a la impresora y los rellenos se comerían el tóner. Para un archivo, déjelo puesto.

Tamaño de página y tablas anchas

El tamaño de página viene en A4. Aquí solo se elige entre A4 y Letter; no hay formato libre.

De ahí sale un problema insalvable. Una página web no tiene anchura: se adapta a la ventana. Un PDF la tiene fija. Una tabla ancha que en el navegador se desplazaba de lado queda recortada por el borde de la hoja.

Dentro de la herramienta no hay manera de sortearlo. Se sortea fuera: reduzca el zoom de la página en el navegador antes de guardar, y la tabla entrará en el ancho.

Cuándo el HTML se convierte en texto plano

Existe una vía rápida automática. Los archivos HTML muy grandes que no contienen imágenes, ni tablas, ni estilos incrustados, ni medios se dibujan como texto plano, sin maquetación.

Es una decisión deliberada: dibujar por completo una página de varios megabytes de texto puro sale caro y da lo mismo.

No ocurre en silencio. El resultado lleva un aviso de que el documento se armó de forma simplificada y el formato no se conservó. Si ese resultado no le sirve, el archivo cayó en la heurística por error y conviene volver a guardar la página de modo que conserve su marcado.

Qué hacer con el archivo terminado

Tres pasos que conviene dar enseguida.

Revise el peso. Una página llena de imágenes da un PDF pesado, y compress-pdf lo reducirá sin tocar el texto.

Rellene las propiedades del documento. En un PDF hecho a partir de HTML, el campo de título suele estar vacío o contener una cadena técnica. Un título con sentido y una fecha mediante set-pdf-metadata facilitan mucho la búsqueda en el archivo un año después.

Si son varias páginas que forman un mismo documento, únalas con merge-pdf en orden de lectura y no en el orden en que las guardó.

Y por último. Para conservación larga vale la pena pasar el resultado por pdf-to-pdfa: el perfil de archivo exige que todo lo necesario para mostrarlo viva dentro del fichero, que es justo lo que un archivo quiere.

FAQ

No, la herramienta trabaja con un archivo. Guarde la página desde el navegador como HTML y suba el resultado. La opción de guardado que empaqueta la página entera en un solo fichero es la que mejor funciona.
La página se dibuja aislada: las peticiones a archivos locales se bloquean, y de las direcciones externas solo se permiten las visibles en el HTML durante un análisis estático. Las imágenes que un script trae después de abrir la página nunca llegan al motor de dibujo.
Es la vía rápida automática: los archivos HTML muy grandes sin imágenes, tablas, estilos incrustados ni medios se dibujan como texto. El resultado lleva un aviso de que el formato no se conservó.
No, el flujo básico funciona sin registrarse.
Los archivos se usan solo para la operación elegida y se eliminan automáticamente al terminar el procesamiento. No usamos los documentos subidos para entrenar modelos de IA.

Más de este cluster

Herramientas relacionadas

← Todas las herramientas de Convertir

Qué hacer después

Si después de leer necesitas el siguiente paso práctico o más contexto sobre el servicio, abre estas páginas.

Todas las herramientas

Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.

FAQ

Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.

Contacto

Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.