HTML a PDF: guardar una web
En resumen: La página la dibuja un navegador sin interfaz a partir del archivo HTML que usted sube. Las rutas locales no se piden en absoluto, y las externas solo si figuran en el propio HTML. Un archivo fiable sale de un único fichero autosuficiente con todo incrustado dentro.
Cluster
seguridad
Flujos de protección, control de acceso, redacción y compartición controlada.
Herramienta principal
HTML a PDF en línea
Abre la herramienta de este artículo y completa la operación en la localización actual.
Abrir herramientaTabla de contenidos
- La herramienta acepta un archivo, no una dirección
- Por qué desaparecen las imágenes
- Todo lo que aparece tras la carga no llega al PDF
- En qué se diferencia un archivo PDF de una captura y de un marcador
- Cómo hacer el guardado
- La gráfica de fondo y por qué dejarla activada
- Tamaño de página y tablas anchas
- Cuándo el HTML se convierte en texto plano
- Qué hacer con el archivo terminado
Guardar una página web en PDF: qué llega al archivo y qué no
Hay que conservar una página de modo que dentro de un año se abra y se vea como hoy: unas condiciones de servicio, una página de tarifas, un artículo que alguien podría editar. El PDF sirve mejor que una captura, porque el texto sobrevive, y mejor que un marcador, porque no depende del servidor ajeno.
Pero entre «página en el navegador» y «página en PDF» hay unos cuantos pasos donde se pierde contenido. Veamos dónde.
La herramienta acepta un archivo, no una dirección
Lo primero que conviene entender: aquí no se escribe la dirección de un sitio. Se sube un archivo HTML guardado.
Su navegador sabe guardar la página. El diálogo de guardado suele ofrecer elegir entre solo HTML y una opción que empaqueta la página completa. La segunda es bastante mejor: reúne marcado, estilos e imágenes en un fichero, y eso es lo que un archivo necesita.
Por qué está hecho así lo explica el apartado siguiente, y esa misma explicación cubre la mayoría de los resultados sorprendentes.
Por qué desaparecen las imágenes
La página se dibuja en un navegador aislado, y el contenido se le entrega directamente en lugar de abrirse desde una ruta de archivo. Una página así no tiene ubicación en disco desde la que leer ficheros vecinos.
De ahí una regla dura: las referencias a archivos locales no funcionan. Si junto a su `page.html` hay una carpeta `page_files` llena de imágenes, ninguna llega al PDF. El navegador sencillamente no puede alcanzarlas.
Las direcciones externas sí funcionan, pero no todas. Antes de dibujar, el HTML se analiza estáticamente, se construye una lista de direcciones y solo esas se descargan. Un recurso del que el marcado no dice nada queda bloqueado, y una redirección a otra dirección también.
Hay una conclusión práctica: un archivo fiable sale de un fichero autosuficiente, donde imágenes y estilos van incrustados en el marcado y no al lado.
Todo lo que aparece tras la carga no llega al PDF
La segunda fuente de pérdidas es la dinámica.
Una página moderna suele traer contenido después de abrirse: imágenes al desplazarse, comentarios al pulsar, una tabla de datos como petición aparte. El dibujado trabaja con el marcado y no con la página viva, y lo que se carga más tarde no está allí.
Por lo mismo, los bloques plegados siguen plegados, las pestañas distintas de la activa faltan y todo lo que se muestra al pasar el ratón no aparece.
Puede comprobarlo de antemano: desactive los scripts en el navegador y recargue la página. Lo que siga visible llegará al PDF. Lo que se esfume, no.
En qué se diferencia un archivo PDF de una captura y de un marcador
Tres maneras de conservar una página resuelven problemas distintos, y confundirlas sale caro.
| Método | Qué se conserva | Qué falta |
|---|---|---|
| Marcador | Nada salvo la dirección | La página puede cambiar o desaparecer |
| Captura | Una imagen del área visible | El texto no se busca ni se copia, una página larga no cabe |
| Texto, formato, todas las páginas enteras | Interactividad y lo que cargan los scripts |
Para una tarea probatoria importa la tercera columna de la segunda fila. Una captura de una página de tarifas no permite encontrar una cláusula por búsqueda ni muestra lo que había más abajo. El PDF hace ambas cosas.
Conviene recordar aparte que ninguno de los tres es prueba jurídica del contenido de una página en una fecha. Para eso existe el acta notarial, y funciona de otro modo.
Cómo hacer el guardado
1. Abra la página en el navegador y guárdela como HTML, eligiendo la opción de fichero único. 2. Abra html-to-pdf y suba el archivo guardado. 3. Elija el tamaño de página: A4 o Letter. 4. Deje activada la gráfica de fondo si el diseño importa. 5. Ejecute la tarea y compare el resultado con la página original.
Haga el paso cinco de inmediato y no un mes después: si algo se perdió, la página sigue disponible y puede guardarse de otra forma.
La gráfica de fondo y por qué dejarla activada
El interruptor de gráfica de fondo controla si los rellenos, las imágenes de fondo y los paneles de color llegan al PDF.
Viene activado, y para un archivo eso es lo correcto: apagado, convierte el texto sobre un panel de color en texto sobre blanco, y parte del sentido del diseño se pierde. Se nota sobre todo en advertencias marcadas por color y en tablas de filas alternas.
Hay exactamente un motivo para apagarlo: la página va a la impresora y los rellenos se comerían el tóner. Para un archivo, déjelo puesto.
Tamaño de página y tablas anchas
El tamaño de página viene en A4. Aquí solo se elige entre A4 y Letter; no hay formato libre.
De ahí sale un problema insalvable. Una página web no tiene anchura: se adapta a la ventana. Un PDF la tiene fija. Una tabla ancha que en el navegador se desplazaba de lado queda recortada por el borde de la hoja.
Dentro de la herramienta no hay manera de sortearlo. Se sortea fuera: reduzca el zoom de la página en el navegador antes de guardar, y la tabla entrará en el ancho.
Cuándo el HTML se convierte en texto plano
Existe una vía rápida automática. Los archivos HTML muy grandes que no contienen imágenes, ni tablas, ni estilos incrustados, ni medios se dibujan como texto plano, sin maquetación.
Es una decisión deliberada: dibujar por completo una página de varios megabytes de texto puro sale caro y da lo mismo.
No ocurre en silencio. El resultado lleva un aviso de que el documento se armó de forma simplificada y el formato no se conservó. Si ese resultado no le sirve, el archivo cayó en la heurística por error y conviene volver a guardar la página de modo que conserve su marcado.
Qué hacer con el archivo terminado
Tres pasos que conviene dar enseguida.
Revise el peso. Una página llena de imágenes da un PDF pesado, y compress-pdf lo reducirá sin tocar el texto.
Rellene las propiedades del documento. En un PDF hecho a partir de HTML, el campo de título suele estar vacío o contener una cadena técnica. Un título con sentido y una fecha mediante set-pdf-metadata facilitan mucho la búsqueda en el archivo un año después.
Si son varias páginas que forman un mismo documento, únalas con merge-pdf en orden de lectura y no en el orden en que las guardó.
Y por último. Para conservación larga vale la pena pasar el resultado por pdf-to-pdfa: el perfil de archivo exige que todo lo necesario para mostrarlo viva dentro del fichero, que es justo lo que un archivo quiere.
FAQ
Más de este cluster
seguridad
Proteger un PDF con contraseña
Cómo poner contraseña a un PDF antes de enviarlo por correo, qué protege realmente y qué tener en cuenta para no quedarte fuera de tu propio documento.
seguridad
Cómo quitar la contraseña de un PDF
Un PDF lleva dos mecanismos de protección y solo uno es real. Qué le da el cifrado, por qué una restricción de copia es una petición, y por qué un campo de contraseña vacío a veces resuelve la tarea.
seguridad
Borrar datos confidenciales en PDF
Un rectángulo negro dibujado sobre el texto no borra nada. En qué se diferencian de fondo los estilos de redacción, por qué el desenfoque no cuenta como eliminación y qué pasa con los metadatos.
Herramientas relacionadas
HTML a PDF en línea
Convierte una página HTML a PDF para guardar su contenido como documento para archivo o envío.
Comprimir PDF en línea
Reduce el tamaño de un PDF para enviarlo, subirlo o guardarlo con más facilidad. Es especialmente útil para escaneos y documentos con imágenes.
Unir PDF en línea
Une varios PDF en un solo archivo: un contrato con sus anexos, un lote de escaneos de un documento o las secciones de un informe, que es más fácil enviar como un único adjunto que en diez correos distintos.
PDF a PDF/A en línea
Convierte un PDF normal a PDF/A, un formato diseñado para un almacenamiento fiable a largo plazo.
Qué hacer después
Todas las herramientas
Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.
FAQ
Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.
Contacto
Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.