Pular para o conteúdo
Artigo

Extrair tabelas de PDF para Excel

De PDF para Excel: quais planilhas acabam na pasta baixada, em que os três modos de detecção diferem na prática e por que o modo flexível acha mais tabelas mas parte as palavras.

Em resumo: Para passar tabelas de um PDF para o Excel, abra o pdf-to-excel e deixe a detecção no automático. A pasta traz uma planilha de sumário, uma de texto, uma imagem de cada página e uma planilha separada de células reais para cada tabela encontrada.

Cluster

guia passo a passo

Instruções passo a passo para levar uma tarefa PDF da entrada a um resultado confiável.

13 artigos

Ferramenta principal

PDF para Excel online

Abra a ferramenta deste artigo e conclua a operação na localização atual.

Abrir ferramenta

Índice

Como passar tabelas de um PDF para o Excel

Um relatório traz uma tabela, e ela precisa ser recalculada em vez de redigitada. A ferramenta faz para isso mais do que o nome sugere: ela não apenas despeja texto, ela monta uma pasta de trabalho com várias planilhas de funções diferentes. Entender como essa pasta é construída compensa antes da primeira tentativa.

O que existe de fato no arquivo baixado

O resultado não é uma planilha de dados. É uma pasta cujas planilhas cumprem papéis distintos.

PlanilhaO que traz
SumárioUm índice de páginas com links para as outras planilhas
TextoO texto do documento, uma linha por página
Página NUma imagem da página inteira do PDF
Tabela N.MUma tabela detectada em células de verdade

É pela última linha que tudo acontece. As planilhas de tabelas trazem dados sobre os quais dá para pôr fórmulas. As imagens de página e a planilha de texto são o seguro para o caso de alguma tabela não ter sido detectada: o conteúdo fica diante dos olhos de qualquer jeito.

A planilha de sumário funciona como um índice: o número da página, um link para a planilha dela e a primeira linha do seu texto para orientação. Os links saltam dentro da própria pasta.

Três modos de detecção

O parâmetro de detecção muda como a ferramenta procura as bordas das células, e isso muda o resultado mais do que qualquer outra coisa.

ModoComo acha a tabelaO que a pasta traz
AutomáticoPelas linhas da gradeTodas as planilhas, inclusive a de texto
EstritoPelas linhas, com exigências duras sobre como se cruzamNenhuma planilha de texto
FlexívelPela posição do próprio texto, sem se apoiar em linhasTodas as planilhas, e o texto inteiro da página num comentário de célula

O automático é o padrão. O estrito difere dele em mais do que o rigor com as linhas: ele tira da pasta a planilha de texto e deixa só tabelas e imagens. Faz sentido quando o resultado alimenta outro processamento e planilhas a mais atrapalham.

O flexível é o único modo que enxerga tabelas sem grade. Isso se paga, e o preço é alto.

Ele tem ainda um efeito colateral às vezes mais útil que a função principal: no modo flexível o texto inteiro da página também vai para um comentário anexado à primeira célula da planilha com a imagem. Passando o cursor por cima, lê-se o conteúdo da página sem trocar para a planilha de texto.

O que a medição mostrou

O objeto foi um documento cuja primeira página traz duas tabelas: uma com linhas e outra sem nenhuma, apenas colunas alinhadas.

O automático e o estrito acharam só a primeira e a transportaram impecável: três linhas, três colunas, valores no lugar.

O flexível achou as duas, mas juntou tudo numa única grade e de quebra partiu palavras entre colunas. A palavra «Region» virou duas células, «Re» e «gion». «North» virou «No» e «rth». O número 900 se separou em «9» e «00». Entre as linhas de dados apareceram linhas vazias.

A conclusão prática: comece pelo automático. Se nenhuma tabela aparecer e o documento realmente não tiver linhas, mude para o flexível, mas reserve tempo para montar à mão. Ele dá material, não um resultado pronto.

E o contrário: se a tabela no PDF está desenhada com linhas e o resultado continua vazio, o modo não é o problema. O documento provavelmente não tem camada de texto.

Como transportar a tabela

1. Abra o pdf-to-excel e envie o documento. 2. Deixe a detecção no automático para a primeira tentativa. 3. Rode o processamento e baixe a pasta de trabalho. 4. Abra a planilha de sumário e salte para as planilhas de tabelas. 5. Confira os números de duas ou três linhas com a imagem da página na planilha vizinha. 6. Se nenhuma tabela apareceu, repita no modo flexível.

O quinto ponto existe justamente porque a imagem da página está na mesma pasta. Conferir o que veio com o original nunca exige sair do Excel.

Células mescladas e ordenação

A chave de mesclagem vem ligada. Ela diz respeito às células que na tabela de origem se estendem por várias colunas: ligada, ela as restaura como intervalos mesclados de verdade e reproduz a aparência do original.

Desligada, ela quebra essas células em comuns: o valor fica na primeira e as demais ficam vazias.

Escolha pelo que pretende fazer com os dados.

Se a tabela vai ser lida e impressa, deixe a mesclagem ligada: o resultado bate com o original.

Se os dados vão ser ordenados, filtrados ou levados a uma tabela dinâmica, desligue. O Excel se recusa a ordenar um intervalo com células mescladas e exige que todas tenham o mesmo tamanho. Desfazer as mesclagens à mão depois leva mais tempo do que virar a chave antes.

Por que o arquivo pesa mais do que se espera

Cada página do PDF entra na pasta como planilha própria com uma imagem em tamanho cheio, desenhada com quase o dobro da resolução. Essas imagens formam quase todo o peso do resultado.

Num documento de teste pequeno a diferença salta aos olhos: o PDF de origem pesava 2 KB e a pasta saiu em torno de 45 KB. Em relatórios reais a conta vai em megabytes, e cresce com o número de páginas, não com o de tabelas.

Se só os dados importam e as imagens atrapalham, as planilhas sobrando se apagam no Excel em dois movimentos, e o arquivo emagrece ao ser salvo.

Um escaneamento e uma tabela sem camada de texto

A ferramenta lê texto, não o reconhece. Uma tabela escaneada é imagem para ela: a imagem da página estará na pasta, a planilha de texto sairá vazia e nenhum modo achará tabelas.

O remédio vem antes da conversão: passe o arquivo pelo ocr-pdf, consiga uma camada de texto e só então converta para planilha. A ordem inversa não serve, porque não sobra nada para o Excel reconhecer.

O mesmo truque ajuda com documentos cujo texto existe mas está torto: uma página fotografada de lado é reconhecida pior que uma reta, e endireitá-la antes do reconhecimento muda o resultado de forma perceptível.

Limites, avisos e ferramentas vizinhas

Se a detecção de tabelas falhar em alguma página, a tarefa não cai. A pasta chega inteira e a resposta traz um aviso nomeando essas páginas: delas não sairão tabelas, a imagem e o texto ficam. O mesmo vale para páginas cujo texto não pôde ser lido.

Um documento com senha de abertura não pode ser processado; remova a proteção pelo unlock-pdf. Uma senha que limita apenas a impressão ou a cópia não atrapalha a extração de tabelas.

Quando uma página traz várias tabelas, cada uma recebe a sua planilha, nomeada pelo número da página e pela posição da tabela nela. O Excel limita o tamanho dos nomes de planilha, então rótulos longos são aparados e coincidências separadas por um sufixo numérico.

Se o que você precisa do documento é texto para editar e não tabelas, isso é o pdf-to-word no modo contínuo: lá o mesmo detector as transporta como tabelas do Word de verdade. E devolver a pasta pronta a PDF é o excel-to-pdf.

FAQ

Primeiro veja se a tabela tem linhas: os modos automático e estrito procuram as bordas das células ao longo das linhas. Uma tabela sem grade só é vista pelo modo flexível. Se as linhas estão lá e o resultado segue vazio, provavelmente falta a camada de texto e é preciso OCR.
Ele se apoia na posição do texto e não nas linhas, e na medição partiu palavras entre colunas: Region virou Re e gion, e o número 900 se separou em 9 e 00. Ele dá material para montar à mão, não uma tabela pronta.
Por causa das células mescladas: a chave de mesclagem vem ligada e restaura as células que se estendiam por várias colunas. Se os dados vão ser ordenados ou levados a uma tabela dinâmica, desligue-a antes do processamento.
Cada página do PDF entra nela como planilha própria com uma imagem em tamanho cheio. Essas imagens formam quase todo o peso. Se só os dados importam, as planilhas sobrando se apagam no Excel e o arquivo emagrece ao ser salvo.
Os arquivos são usados apenas para a operação escolhida e são excluídos automaticamente depois de concluído o processamento. Não usamos documentos enviados para treinar modelos de IA.

Mais deste cluster

Ferramentas relacionadas

← Todas as ferramentas de Converter

O que fazer em seguida

Se depois da leitura você precisar do próximo passo prático ou de mais contexto sobre o serviço, abra estas páginas.

Todas as ferramentas

Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.

FAQ

Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.

Contato

Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.