Como converter PDF em Word editável
Em resumo: Para obter um Word realmente editável, mude o tipo de resultado no pdf-to-word para contínuo: o padrão é o exato, que insere cada página como imagem com uma camada oculta para busca. O modo contínuo reconstrói parágrafos, títulos e tabelas do Word de verdade.
Cluster
guia passo a passo
Instruções passo a passo para levar uma tarefa PDF da entrada a um resultado confiável.
Ferramenta principal
PDF para Word online
Abra a ferramenta deste artigo e conclua a operação na localização atual.
Abrir ferramentaÍndice
Converter PDF em Word editável
O pedido é quase sempre o mesmo: corrigir dois parágrafos de um PDF que alguém mandou. E a primeira tentativa quase sempre decepciona. O arquivo abre no Word, parece perfeito, e o cursor não entra no texto. Isso não é falha da conversão, e sim consequência do ajuste que vem de fábrica.
Por padrão sai uma imagem, não texto
A ferramenta tem dois modos, e o seletor entre eles se chama tipo de resultado. Vem marcado o exato, que faz exatamente o que promete: preserva a aparência da página letra por letra. O método é rude: cada página do PDF é desenhada como imagem e colada inteira no documento do Word.
Daí a sensação de troca. É um .docx, abre no Word, as páginas batem com o original em tamanho e orientação, e não há o que editar: o que ocupa a página são imagens.
O segundo modo, o contínuo, desmonta a página e reconstrói com as peças um documento do Word de verdade: parágrafos, títulos, listas e tabelas. Em troca, perde-se a colocação exata dos elementos na página.
| Modo | O que há dentro | O que dá para fazer |
|---|---|---|
| Exato | Uma imagem de cada página mais uma camada de texto oculta | Ler, buscar no texto, imprimir |
| Contínuo | Parágrafos, títulos, listas e tabelas do Word | Editar o texto, mudar estilos, trabalhar com tabelas |
A escolha não é sobre qualidade e sim sobre a tarefa. Um documento que precisa seguir adiante num formato de escritório conhecido e ficar intocado pede o exato. Um documento que precisa mudar pede o contínuo, e nenhum ajuste do modo exato produz texto editável.
O que existe dentro do arquivo exato
A imagem da página não é todo o conteúdo dela. Por baixo vai também o texto extraído do PDF, marcado como oculto: ele não aparece na tela nem na impressão, mas a busca do documento o encontra.
Isso torna o modo exato útil justamente onde parece inútil. Um contrato que precisa circular e no qual depois se procurarão cláusulas funciona bem assim: a aparência se mantém, a busca responde e ninguém edita por acidente. A própria ferramenta avisa ao terminar que o documento não é texto editável, e vale ler esse aviso em vez de fechá-lo.
O tamanho e a orientação da página vêm do PDF de origem, página a página. Uma folha deitada no meio de um documento em pé continua deitada.
Como obter um documento que se edita
1. Abra o pdf-to-word e envie o arquivo. 2. Mude o tipo de resultado para contínuo. Esse é o gesto decisivo, e por padrão ele não está feito. 3. Decida sobre as prévias de página, tratadas adiante, e desligue-as se não quiser. 4. Rode o processamento e baixe o .docx. 5. Abra o documento e percorra o painel de navegação: ele mostra quais títulos foram reconhecidos. 6. Confira as tabelas e a primeira página, onde as perdas costumam aparecer.
Os cabeçalhos repetidos somem de propósito
O modo contínuo faz uma passagem à parte por todo o documento procurando linhas repetidas. Valem duas condições: a linha precisa estar no décimo superior ou inferior da página e repetir-se em pelo menos três páginas e em pelo menos metade do documento. Tudo que cumpre as duas sai do resultado.
A comparação não é ingênua. Sequências de dígitos são reduzidas, de modo que “Página 4” e “Página 5” contam como a mesma linha. Mas a redução só entra se sobrarem letras na linha: um número solto no rodapé é comparado de forma exata, e três algarismos diferentes em três páginas não são iguais entre si. Na prática um rodapé com “Confidencial. Página 7” vai embora, enquanto um rodapé que seja só um número fica como parágrafo em cada página.
Verificado num relatório de quatro páginas: a linha `Confidential report Page N` está ausente do resultado contínuo e presente no exato, onde a página é uma imagem e não há o que retirar dela.
O mecanismo também tem o seu avesso. Um título de documento em corpo grande no topo de cada página, idêntico em todas, cai sob a mesma regra e é apagado junto com os cabeçalhos. Se essa linha de cima importa, redigitá-la sai mais rápido do que procurar a causa.
Os títulos são decididos pelo tamanho da letra
Os estilos de título do resultado não são inventados. A ferramenta calcula primeiro, para o documento inteiro, qual tamanho de letra é o corpo do texto. Conta caracteres e não linhas, então uma linha grande e rara nunca ganha a votação.
Depois cada bloco é medido contra esse tamanho. Cerca de 15 por cento maior que o corpo dá um título de nível dois, uma vez e meia ou mais dá o nível um. O resto continua parágrafo comum. O texto ainda precisa parecer um título: uma frase longa terminada em ponto não vira título, seja qual for a letra.
Isso produz um comportamento previsível em documentos diagramados sem estilos. Se todo o texto está num só corpo e as seções são marcadas apenas em negrito, o arquivo do Word não terá título algum: o tamanho não varia e não há em que se apoiar. O painel de navegação sai vazio e a estrutura precisa ser posta à mão.
As tabelas saem como tabelas
As tabelas são achadas por um detector à parte, o mesmo sobre o qual o pdf-to-excel é construído. Uma tabela detectada chega ao documento como tabela do Word de verdade, com grade visível, e não como parágrafos entulhados de espaços.
Os blocos de texto que caem dentro dos limites de uma tabela detectada saem do fluxo de parágrafos; do contrário o conteúdo das células apareceria duas vezes, uma como tabela e outra como prosa. O limiar é uma sobreposição de seis décimos da área do bloco.
Onde a tabela aterrissa é decidido pela sua borda superior: ela entra antes do primeiro parágrafo que começa abaixo dela. Numa página comum de uma coluna isso dá a ordem certa. Numa página de duas colunas a tabela pode acabar em outro lugar, porque os parágrafos das duas colunas vêm em sequência no arquivo enquanto suas alturas se entrelaçam.
Se a detecção de tabelas falhar em alguma página, a tarefa não cai: essa página passa como texto comum e a resposta traz um aviso nomeando as páginas. Uma resposta vazia e calada não é possível aqui.
O peso do arquivo e as prévias de página
O modo contínuo acrescenta por padrão, depois do texto de cada página, uma imagem dessa página, para haver com que conferir. Nada mais pesa tanto no resultado.
Medido num mesmo documento de quatro páginas:
| Resultado | Tamanho |
|---|---|
| Modo exato | 671 KB |
| Contínuo com prévias de página | 315 KB |
| Contínuo sem prévias | 37 KB |
O PDF de origem pesava cerca de 4 KB. A distância entre as linhas extremas é de dezoito vezes, e ela é toda de imagens. Se o documento vai para trabalho real e não para conferência, desligue as prévias já de saída: elas não se editam, não participam do texto e atrapalham a revisão.
O modo exato ignora esse ajuste por completo, já que a página dele é uma imagem.
Um escaneamento sem camada de texto
Um documento escaneado é uma imagem, e não há nada dentro dele para extrair. No modo exato o resultado é esse mesmo escaneamento reembalado como .docx. No modo contínuo as páginas saem vazias, com uma nota no lugar de cada uma dizendo que a página estava em branco.
O remédio vem antes da conversão, não depois: passe o arquivo pelo ocr-pdf, obtenha um PDF com camada de texto e só então converta para Word. A ordem inversa não funciona, porque não sobrará nada sobre o que reconhecer.
Um documento fechado com senha de abertura também não converte; a tarefa para e pede a senha. Remova a proteção com o unlock-pdf. Uma senha que limita apenas a impressão ou a cópia não atrapalha.
Feitas as correções, o documento em geral precisa voltar a PDF. Para isso existe o word-to-pdf, com o seu próprio comportamento de substituição de fontes, que convém conhecer de antemão.
FAQ
Mais deste cluster
guia passo a passo
Extrair tabelas de PDF para Excel
De PDF para Excel: quais planilhas acabam na pasta baixada, em que os três modos de detecção diferem na prática e por que o modo flexível acha mais tabelas mas parte as palavras.
guia passo a passo
Como extrair páginas de um PDF
Tirar de um PDF as folhas necessárias como arquivo separado: em que os dois modos de saída diferem, por que os arquivos do ZIP guardam os números de página originais e o que faz desligar a preservação do tamanho.
guia passo a passo
Como cortar margens e excessos no PDF
O corte muda apenas a área visível da página, enquanto o conteúdo além dela continua no arquivo. O que isso significa na prática, por que as margens valem para o documento inteiro e como o corte se comporta em páginas giradas.
Ferramentas relacionadas
PDF para Word online
Converta um PDF em um documento Word para editar o texto, ampliar seções e fazer alterações.
Word para PDF online
Converta um documento Word em PDF para fixar o layout e garantir que o arquivo abra igual em todo lugar.
PDF para Excel online
Extraia dados de tabelas de um PDF para o Excel para poder calcular, filtrar e ordenar.
OCR de PDF online
OCR de PDF mantém a tarefa PDF em um único fluxo do navegador: enviar o arquivo, revisar opções, processar e baixar o resultado.
O que fazer em seguida
Todas as ferramentas
Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.
FAQ
Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.
Contato
Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.