Extrair tabelas de PDF para Excel
Em resumo: Para passar tabelas de um PDF para o Excel, abra o pdf-to-excel e deixe a detecção no automático. A pasta traz uma planilha de sumário, uma de texto, uma imagem de cada página e uma planilha separada de células reais para cada tabela encontrada.
Cluster
guia passo a passo
Instruções passo a passo para levar uma tarefa PDF da entrada a um resultado confiável.
Ferramenta principal
PDF para Excel online
Abra a ferramenta deste artigo e conclua a operação na localização atual.
Abrir ferramentaÍndice
Como passar tabelas de um PDF para o Excel
Um relatório traz uma tabela, e ela precisa ser recalculada em vez de redigitada. A ferramenta faz para isso mais do que o nome sugere: ela não apenas despeja texto, ela monta uma pasta de trabalho com várias planilhas de funções diferentes. Entender como essa pasta é construída compensa antes da primeira tentativa.
O que existe de fato no arquivo baixado
O resultado não é uma planilha de dados. É uma pasta cujas planilhas cumprem papéis distintos.
| Planilha | O que traz |
|---|---|
| Sumário | Um índice de páginas com links para as outras planilhas |
| Texto | O texto do documento, uma linha por página |
| Página N | Uma imagem da página inteira do PDF |
| Tabela N.M | Uma tabela detectada em células de verdade |
É pela última linha que tudo acontece. As planilhas de tabelas trazem dados sobre os quais dá para pôr fórmulas. As imagens de página e a planilha de texto são o seguro para o caso de alguma tabela não ter sido detectada: o conteúdo fica diante dos olhos de qualquer jeito.
A planilha de sumário funciona como um índice: o número da página, um link para a planilha dela e a primeira linha do seu texto para orientação. Os links saltam dentro da própria pasta.
Três modos de detecção
O parâmetro de detecção muda como a ferramenta procura as bordas das células, e isso muda o resultado mais do que qualquer outra coisa.
| Modo | Como acha a tabela | O que a pasta traz |
|---|---|---|
| Automático | Pelas linhas da grade | Todas as planilhas, inclusive a de texto |
| Estrito | Pelas linhas, com exigências duras sobre como se cruzam | Nenhuma planilha de texto |
| Flexível | Pela posição do próprio texto, sem se apoiar em linhas | Todas as planilhas, e o texto inteiro da página num comentário de célula |
O automático é o padrão. O estrito difere dele em mais do que o rigor com as linhas: ele tira da pasta a planilha de texto e deixa só tabelas e imagens. Faz sentido quando o resultado alimenta outro processamento e planilhas a mais atrapalham.
O flexível é o único modo que enxerga tabelas sem grade. Isso se paga, e o preço é alto.
Ele tem ainda um efeito colateral às vezes mais útil que a função principal: no modo flexível o texto inteiro da página também vai para um comentário anexado à primeira célula da planilha com a imagem. Passando o cursor por cima, lê-se o conteúdo da página sem trocar para a planilha de texto.
O que a medição mostrou
O objeto foi um documento cuja primeira página traz duas tabelas: uma com linhas e outra sem nenhuma, apenas colunas alinhadas.
O automático e o estrito acharam só a primeira e a transportaram impecável: três linhas, três colunas, valores no lugar.
O flexível achou as duas, mas juntou tudo numa única grade e de quebra partiu palavras entre colunas. A palavra «Region» virou duas células, «Re» e «gion». «North» virou «No» e «rth». O número 900 se separou em «9» e «00». Entre as linhas de dados apareceram linhas vazias.
A conclusão prática: comece pelo automático. Se nenhuma tabela aparecer e o documento realmente não tiver linhas, mude para o flexível, mas reserve tempo para montar à mão. Ele dá material, não um resultado pronto.
E o contrário: se a tabela no PDF está desenhada com linhas e o resultado continua vazio, o modo não é o problema. O documento provavelmente não tem camada de texto.
Como transportar a tabela
1. Abra o pdf-to-excel e envie o documento. 2. Deixe a detecção no automático para a primeira tentativa. 3. Rode o processamento e baixe a pasta de trabalho. 4. Abra a planilha de sumário e salte para as planilhas de tabelas. 5. Confira os números de duas ou três linhas com a imagem da página na planilha vizinha. 6. Se nenhuma tabela apareceu, repita no modo flexível.
O quinto ponto existe justamente porque a imagem da página está na mesma pasta. Conferir o que veio com o original nunca exige sair do Excel.
Células mescladas e ordenação
A chave de mesclagem vem ligada. Ela diz respeito às células que na tabela de origem se estendem por várias colunas: ligada, ela as restaura como intervalos mesclados de verdade e reproduz a aparência do original.
Desligada, ela quebra essas células em comuns: o valor fica na primeira e as demais ficam vazias.
Escolha pelo que pretende fazer com os dados.
Se a tabela vai ser lida e impressa, deixe a mesclagem ligada: o resultado bate com o original.
Se os dados vão ser ordenados, filtrados ou levados a uma tabela dinâmica, desligue. O Excel se recusa a ordenar um intervalo com células mescladas e exige que todas tenham o mesmo tamanho. Desfazer as mesclagens à mão depois leva mais tempo do que virar a chave antes.
Por que o arquivo pesa mais do que se espera
Cada página do PDF entra na pasta como planilha própria com uma imagem em tamanho cheio, desenhada com quase o dobro da resolução. Essas imagens formam quase todo o peso do resultado.
Num documento de teste pequeno a diferença salta aos olhos: o PDF de origem pesava 2 KB e a pasta saiu em torno de 45 KB. Em relatórios reais a conta vai em megabytes, e cresce com o número de páginas, não com o de tabelas.
Se só os dados importam e as imagens atrapalham, as planilhas sobrando se apagam no Excel em dois movimentos, e o arquivo emagrece ao ser salvo.
Um escaneamento e uma tabela sem camada de texto
A ferramenta lê texto, não o reconhece. Uma tabela escaneada é imagem para ela: a imagem da página estará na pasta, a planilha de texto sairá vazia e nenhum modo achará tabelas.
O remédio vem antes da conversão: passe o arquivo pelo ocr-pdf, consiga uma camada de texto e só então converta para planilha. A ordem inversa não serve, porque não sobra nada para o Excel reconhecer.
O mesmo truque ajuda com documentos cujo texto existe mas está torto: uma página fotografada de lado é reconhecida pior que uma reta, e endireitá-la antes do reconhecimento muda o resultado de forma perceptível.
Limites, avisos e ferramentas vizinhas
Se a detecção de tabelas falhar em alguma página, a tarefa não cai. A pasta chega inteira e a resposta traz um aviso nomeando essas páginas: delas não sairão tabelas, a imagem e o texto ficam. O mesmo vale para páginas cujo texto não pôde ser lido.
Um documento com senha de abertura não pode ser processado; remova a proteção pelo unlock-pdf. Uma senha que limita apenas a impressão ou a cópia não atrapalha a extração de tabelas.
Quando uma página traz várias tabelas, cada uma recebe a sua planilha, nomeada pelo número da página e pela posição da tabela nela. O Excel limita o tamanho dos nomes de planilha, então rótulos longos são aparados e coincidências separadas por um sufixo numérico.
Se o que você precisa do documento é texto para editar e não tabelas, isso é o pdf-to-word no modo contínuo: lá o mesmo detector as transporta como tabelas do Word de verdade. E devolver a pasta pronta a PDF é o excel-to-pdf.
FAQ
Mais deste cluster
guia passo a passo
Como converter PDF em Word editável
O arquivo abriu no Word mas o cursor não entra no texto? Por que o padrão entrega uma imagem, em que o modo contínuo difere do exato e para onde foram os cabeçalhos.
guia passo a passo
Como extrair páginas de um PDF
Tirar de um PDF as folhas necessárias como arquivo separado: em que os dois modos de saída diferem, por que os arquivos do ZIP guardam os números de página originais e o que faz desligar a preservação do tamanho.
guia passo a passo
Como cortar margens e excessos no PDF
O corte muda apenas a área visível da página, enquanto o conteúdo além dela continua no arquivo. O que isso significa na prática, por que as margens valem para o documento inteiro e como o corte se comporta em páginas giradas.
Ferramentas relacionadas
PDF para Excel online
Extraia dados de tabelas de um PDF para o Excel para poder calcular, filtrar e ordenar.
Excel para PDF online
Converta uma planilha Excel em PDF para fixar seu visual e imprimi-la ou enviá-la com facilidade.
OCR de PDF online
OCR de PDF mantém a tarefa PDF em um único fluxo do navegador: enviar o arquivo, revisar opções, processar e baixar o resultado.
PDF para Word online
Converta um PDF em um documento Word para editar o texto, ampliar seções e fazer alterações.
O que fazer em seguida
Todas as ferramentas
Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.
FAQ
Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.
Contato
Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.