Pular para o conteúdo
Artigo

HTML em PDF: como salvar uma página

A ferramenta aceita um arquivo HTML salvo e não um endereço, e o desenha num navegador isolado. Daí as regras: imagens locais não são carregadas e tudo o que aparece depois do carregamento nunca chega ao PDF.

Em resumo: A página é desenhada por um navegador sem interface a partir do arquivo HTML que você envia. Caminhos locais não são buscados, e os externos só para os endereços visíveis no próprio HTML. Um arquivo confiável vem de um único arquivo autossuficiente com tudo embutido dentro.

Cluster

segurança

Fluxos de proteção, controle de acesso, redação e compartilhamento controlado.

4 artigos

Ferramenta principal

HTML para PDF online

Abra a ferramenta deste artigo e conclua a operação na localização atual.

Abrir ferramenta

Índice

Salvar uma página da web em PDF: o que chega ao arquivo e o que não

É preciso guardar uma página de modo que daqui a um ano ela abra e pareça o que é hoje: termos de uso, uma página de tarifas, um artigo que alguém pode editar. O PDF serve melhor que uma captura, porque o texto sobrevive, e melhor que um favorito, porque não depende do servidor alheio.

Mas entre «página no navegador» e «página em PDF» há alguns passos em que se perde conteúdo. Vejamos quais.

A ferramenta aceita um arquivo, não um endereço

A primeira coisa a entender: aqui não se digita o endereço de um site. Envia-se um arquivo HTML salvo.

Seu navegador sabe salvar a página. A caixa de salvamento costuma oferecer a escolha entre só HTML e uma opção que empacota a página inteira. A segunda é bem melhor: reúne marcação, estilos e imagens num arquivo, e é disso que um arquivo precisa.

Por que é assim, a seção seguinte explica, e essa mesma explicação cobre a maioria dos resultados surpreendentes.

Por que as imagens somem

A página é desenhada num navegador isolado, e o conteúdo lhe é entregue diretamente em vez de aberto por um caminho de arquivo. Uma página assim não tem lugar no disco de onde ler arquivos vizinhos.

Daí uma regra dura: referências a arquivos locais não funcionam. Se ao lado do seu `page.html` houver uma pasta `page_files` cheia de imagens, nenhuma chega ao PDF. O navegador simplesmente não alcança.

Endereços externos funcionam, mas não quaisquer. Antes de desenhar, o HTML é analisado estaticamente, dele se monta uma lista de endereços, e só esses são buscados. Um recurso sobre o qual a marcação nada diz é bloqueado, e um redirecionamento para outro endereço também.

Há uma conclusão prática: um arquivo confiável vem de um arquivo autossuficiente, em que imagens e estilos estão embutidos na marcação e não ao lado dela.

Tudo o que aparece depois do carregamento não chega ao PDF

A segunda fonte de perdas é a dinâmica.

Uma página moderna costuma trazer conteúdo depois de abrir: imagens conforme se rola, comentários ao clicar, uma tabela de dados como pedido à parte. O desenho trabalha sobre a marcação e não sobre a página viva, e o que carrega depois não está ali.

Pelo mesmo motivo, blocos recolhidos ficam recolhidos, abas diferentes da ativa faltam, e tudo o que aparece ao passar o mouse não existe.

Dá para conferir de antemão: desligue os scripts no navegador e recarregue a página. O que continuar visível chegará ao PDF. O que sumir, não.

Em que um arquivo em PDF difere de uma captura e de um favorito

Três modos de guardar uma página resolvem problemas diferentes, e confundi-los sai caro.

ModoO que se guardaO que falta
FavoritoNada além do endereçoA página pode mudar ou sumir
CapturaUma imagem da área visívelO texto não se busca nem se copia, uma página longa não cabe
PDFTexto, formatação, todas as páginas inteirasInteratividade e o que os scripts carregam

Para uma finalidade probatória, importa a terceira coluna da segunda linha. Uma captura de uma página de tarifas não permite achar uma cláusula por busca nem mostra o que havia mais abaixo. O PDF faz as duas coisas.

Vale lembrar à parte: nenhum dos três é prova jurídica do conteúdo de uma página numa data. Para isso existe a ata notarial, e ela funciona de outro modo.

Como fazer o salvamento

1. Abra a página no navegador e salve como HTML, escolhendo a opção de arquivo único. 2. Abra o html-to-pdf e envie o arquivo salvo. 3. Escolha o tamanho da página: A4 ou Letter. 4. Deixe a gráfica de fundo ligada se o visual importa. 5. Execute e compare o resultado com a página original.

Faça o passo cinco na hora, não um mês depois: se algo se perdeu, a página ainda está disponível e pode ser salva de outro jeito.

A gráfica de fundo e por que deixá-la ligada

A chave de gráfica de fundo controla se preenchimentos, imagens de fundo e painéis coloridos chegam ao PDF.

Ela vem ligada, e para um arquivo isso é o certo: desligada, transforma texto sobre painel colorido em texto sobre branco, e parte do sentido do visual se perde. Isso aparece principalmente em avisos marcados por cor e em tabelas de linhas alternadas.

Há exatamente um motivo para desligá-la: a página vai para a impressora e os preenchimentos comeriam toner. Para arquivo, deixe ligada.

Tamanho da página e tabelas largas

O tamanho da página vem em A4. A escolha aqui é só entre A4 e Letter; não há formato livre.

Daí sai um problema incontornável. Uma página da web não tem largura: ela se adapta à janela. Um PDF tem largura fixa. Uma tabela larga que no navegador rolava para o lado sai cortada na borda da folha.

Dentro da ferramenta não há como contornar. Contorna-se por fora: reduza o zoom da página no navegador antes de salvar, e a tabela caberá na largura.

Quando o HTML vira texto puro

Existe um caminho rápido automático. Arquivos HTML muito grandes que não contêm imagens, nem tabelas, nem estilos embutidos, nem mídia são desenhados como texto puro, sem diagramação.

É uma decisão proposital: desenhar por completo uma página de vários megabytes de texto puro sai caro e entrega o mesmo.

Não acontece em silêncio. O resultado vem com um aviso de que o documento foi montado de forma simplificada e a formatação não foi preservada. Se esse resultado não serve, o arquivo caiu na heurística por engano, e vale salvar a página de novo de modo a manter a marcação.

O que fazer com o arquivo pronto

Três passos que valem já.

Confira o peso. Uma página cheia de imagens dá um PDF pesado, e o compress-pdf o reduz sem tocar no texto.

Preencha as propriedades do documento. Num PDF feito a partir de HTML, o campo de título costuma estar vazio ou trazer uma linha técnica. Um título com sentido e uma data pelo set-pdf-metadata facilitam muito a busca no arquivo um ano depois.

Se forem várias páginas formando um documento, junte-as com o merge-pdf na ordem de leitura e não na ordem em que foram salvas.

E por último. Para guarda longa vale passar o resultado pelo pdf-to-pdfa: o perfil de arquivamento exige que tudo o necessário para exibir esteja dentro do próprio arquivo, que é justamente o que um arquivo quer.

FAQ

Não, a ferramenta trabalha com arquivo. Salve a página no navegador como HTML e envie o resultado. A opção de salvamento que empacota a página inteira num único arquivo funciona melhor.
A página é desenhada isolada: pedidos a arquivos locais são bloqueados, e dos endereços externos só são permitidos os visíveis no HTML durante uma varredura estática. Imagens que um script traz depois de a página abrir nunca chegam ao renderizador.
É o caminho rápido automático: arquivos HTML muito grandes sem imagens, tabelas, estilos embutidos e mídia são desenhados como texto. O resultado vem com um aviso de que a formatação não foi preservada.
Não, o fluxo básico funciona sem cadastro.
Os arquivos são usados apenas para a operação escolhida e removidos automaticamente ao fim do processamento. Não usamos documentos enviados para treinar modelos de IA.

Mais deste cluster

Ferramentas relacionadas

← Todas as ferramentas de Converter

O que fazer em seguida

Se depois da leitura você precisar do próximo passo prático ou de mais contexto sobre o serviço, abra estas páginas.

Todas as ferramentas

Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.

FAQ

Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.

Contato

Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.