Pular para o conteúdo
Artigo

Como converter PDF em Word editável

O arquivo abriu no Word mas o cursor não entra no texto? Por que o padrão entrega uma imagem, em que o modo contínuo difere do exato e para onde foram os cabeçalhos.

Em resumo: Para obter um Word realmente editável, mude o tipo de resultado no pdf-to-word para contínuo: o padrão é o exato, que insere cada página como imagem com uma camada oculta para busca. O modo contínuo reconstrói parágrafos, títulos e tabelas do Word de verdade.

Cluster

guia passo a passo

Instruções passo a passo para levar uma tarefa PDF da entrada a um resultado confiável.

13 artigos

Ferramenta principal

PDF para Word online

Abra a ferramenta deste artigo e conclua a operação na localização atual.

Abrir ferramenta

Índice

Converter PDF em Word editável

O pedido é quase sempre o mesmo: corrigir dois parágrafos de um PDF que alguém mandou. E a primeira tentativa quase sempre decepciona. O arquivo abre no Word, parece perfeito, e o cursor não entra no texto. Isso não é falha da conversão, e sim consequência do ajuste que vem de fábrica.

Por padrão sai uma imagem, não texto

A ferramenta tem dois modos, e o seletor entre eles se chama tipo de resultado. Vem marcado o exato, que faz exatamente o que promete: preserva a aparência da página letra por letra. O método é rude: cada página do PDF é desenhada como imagem e colada inteira no documento do Word.

Daí a sensação de troca. É um .docx, abre no Word, as páginas batem com o original em tamanho e orientação, e não há o que editar: o que ocupa a página são imagens.

O segundo modo, o contínuo, desmonta a página e reconstrói com as peças um documento do Word de verdade: parágrafos, títulos, listas e tabelas. Em troca, perde-se a colocação exata dos elementos na página.

ModoO que há dentroO que dá para fazer
ExatoUma imagem de cada página mais uma camada de texto ocultaLer, buscar no texto, imprimir
ContínuoParágrafos, títulos, listas e tabelas do WordEditar o texto, mudar estilos, trabalhar com tabelas

A escolha não é sobre qualidade e sim sobre a tarefa. Um documento que precisa seguir adiante num formato de escritório conhecido e ficar intocado pede o exato. Um documento que precisa mudar pede o contínuo, e nenhum ajuste do modo exato produz texto editável.

O que existe dentro do arquivo exato

A imagem da página não é todo o conteúdo dela. Por baixo vai também o texto extraído do PDF, marcado como oculto: ele não aparece na tela nem na impressão, mas a busca do documento o encontra.

Isso torna o modo exato útil justamente onde parece inútil. Um contrato que precisa circular e no qual depois se procurarão cláusulas funciona bem assim: a aparência se mantém, a busca responde e ninguém edita por acidente. A própria ferramenta avisa ao terminar que o documento não é texto editável, e vale ler esse aviso em vez de fechá-lo.

O tamanho e a orientação da página vêm do PDF de origem, página a página. Uma folha deitada no meio de um documento em pé continua deitada.

Como obter um documento que se edita

1. Abra o pdf-to-word e envie o arquivo. 2. Mude o tipo de resultado para contínuo. Esse é o gesto decisivo, e por padrão ele não está feito. 3. Decida sobre as prévias de página, tratadas adiante, e desligue-as se não quiser. 4. Rode o processamento e baixe o .docx. 5. Abra o documento e percorra o painel de navegação: ele mostra quais títulos foram reconhecidos. 6. Confira as tabelas e a primeira página, onde as perdas costumam aparecer.

Os cabeçalhos repetidos somem de propósito

O modo contínuo faz uma passagem à parte por todo o documento procurando linhas repetidas. Valem duas condições: a linha precisa estar no décimo superior ou inferior da página e repetir-se em pelo menos três páginas e em pelo menos metade do documento. Tudo que cumpre as duas sai do resultado.

A comparação não é ingênua. Sequências de dígitos são reduzidas, de modo que “Página 4” e “Página 5” contam como a mesma linha. Mas a redução só entra se sobrarem letras na linha: um número solto no rodapé é comparado de forma exata, e três algarismos diferentes em três páginas não são iguais entre si. Na prática um rodapé com “Confidencial. Página 7” vai embora, enquanto um rodapé que seja só um número fica como parágrafo em cada página.

Verificado num relatório de quatro páginas: a linha `Confidential report Page N` está ausente do resultado contínuo e presente no exato, onde a página é uma imagem e não há o que retirar dela.

O mecanismo também tem o seu avesso. Um título de documento em corpo grande no topo de cada página, idêntico em todas, cai sob a mesma regra e é apagado junto com os cabeçalhos. Se essa linha de cima importa, redigitá-la sai mais rápido do que procurar a causa.

Os títulos são decididos pelo tamanho da letra

Os estilos de título do resultado não são inventados. A ferramenta calcula primeiro, para o documento inteiro, qual tamanho de letra é o corpo do texto. Conta caracteres e não linhas, então uma linha grande e rara nunca ganha a votação.

Depois cada bloco é medido contra esse tamanho. Cerca de 15 por cento maior que o corpo dá um título de nível dois, uma vez e meia ou mais dá o nível um. O resto continua parágrafo comum. O texto ainda precisa parecer um título: uma frase longa terminada em ponto não vira título, seja qual for a letra.

Isso produz um comportamento previsível em documentos diagramados sem estilos. Se todo o texto está num só corpo e as seções são marcadas apenas em negrito, o arquivo do Word não terá título algum: o tamanho não varia e não há em que se apoiar. O painel de navegação sai vazio e a estrutura precisa ser posta à mão.

As tabelas saem como tabelas

As tabelas são achadas por um detector à parte, o mesmo sobre o qual o pdf-to-excel é construído. Uma tabela detectada chega ao documento como tabela do Word de verdade, com grade visível, e não como parágrafos entulhados de espaços.

Os blocos de texto que caem dentro dos limites de uma tabela detectada saem do fluxo de parágrafos; do contrário o conteúdo das células apareceria duas vezes, uma como tabela e outra como prosa. O limiar é uma sobreposição de seis décimos da área do bloco.

Onde a tabela aterrissa é decidido pela sua borda superior: ela entra antes do primeiro parágrafo que começa abaixo dela. Numa página comum de uma coluna isso dá a ordem certa. Numa página de duas colunas a tabela pode acabar em outro lugar, porque os parágrafos das duas colunas vêm em sequência no arquivo enquanto suas alturas se entrelaçam.

Se a detecção de tabelas falhar em alguma página, a tarefa não cai: essa página passa como texto comum e a resposta traz um aviso nomeando as páginas. Uma resposta vazia e calada não é possível aqui.

O peso do arquivo e as prévias de página

O modo contínuo acrescenta por padrão, depois do texto de cada página, uma imagem dessa página, para haver com que conferir. Nada mais pesa tanto no resultado.

Medido num mesmo documento de quatro páginas:

ResultadoTamanho
Modo exato671 KB
Contínuo com prévias de página315 KB
Contínuo sem prévias37 KB

O PDF de origem pesava cerca de 4 KB. A distância entre as linhas extremas é de dezoito vezes, e ela é toda de imagens. Se o documento vai para trabalho real e não para conferência, desligue as prévias já de saída: elas não se editam, não participam do texto e atrapalham a revisão.

O modo exato ignora esse ajuste por completo, já que a página dele é uma imagem.

Um escaneamento sem camada de texto

Um documento escaneado é uma imagem, e não há nada dentro dele para extrair. No modo exato o resultado é esse mesmo escaneamento reembalado como .docx. No modo contínuo as páginas saem vazias, com uma nota no lugar de cada uma dizendo que a página estava em branco.

O remédio vem antes da conversão, não depois: passe o arquivo pelo ocr-pdf, obtenha um PDF com camada de texto e só então converta para Word. A ordem inversa não funciona, porque não sobrará nada sobre o que reconhecer.

Um documento fechado com senha de abertura também não converte; a tarefa para e pede a senha. Remova a proteção com o unlock-pdf. Uma senha que limita apenas a impressão ou a cópia não atrapalha.

Feitas as correções, o documento em geral precisa voltar a PDF. Para isso existe o word-to-pdf, com o seu próprio comportamento de substituição de fontes, que convém conhecer de antemão.

FAQ

Porque o tipo de resultado vem no exato: cada página é inserida como imagem e por baixo fica uma camada de texto oculta para a busca. Para conseguir um documento editável, mude o tipo de resultado para contínuo e converta de novo.
No modo contínuo as tabelas detectadas chegam como tabelas do Word de verdade, com grade visível. Se a detecção falhar em alguma página, o conteúdo dela passa como texto comum e a resposta traz um aviso nomeando essas páginas.
O modo contínuo remove linhas que ficam no décimo superior ou inferior da página e se repetem em pelo menos três páginas e em pelo menos metade do documento. Um título idêntico no topo de cada página cai sob a mesma regra.
Não diretamente. Um escaneamento não tem camada de texto, então o modo contínuo devolve páginas vazias. Passe o arquivo primeiro pelo ocr-pdf e converta para Word o PDF resultante.
Os arquivos são usados apenas para a operação escolhida e são excluídos automaticamente depois de concluído o processamento. Não usamos documentos enviados para treinar modelos de IA.

Mais deste cluster

Ferramentas relacionadas

← Todas as ferramentas de Converter

O que fazer em seguida

Se depois da leitura você precisar do próximo passo prático ou de mais contexto sobre o serviço, abra estas páginas.

Todas as ferramentas

Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.

FAQ

Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.

Contato

Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.