Saltar al contenido
Artículo

Cómo extraer tablas de PDF a Excel

De PDF a Excel: qué hojas acaban en el libro descargado, en qué se diferencian en la práctica los tres modos de detección y por qué el modo flexible encuentra más tablas pero rompe las palabras.

En resumen: Para pasar tablas de un PDF a Excel, abre pdf-to-excel y deja la detección en automático. El libro traerá una hoja de contenido, una de texto, una imagen de cada página y una hoja aparte de celdas reales por cada tabla encontrada.

Cluster

guía paso a paso

Instrucciones paso a paso para llevar una tarea PDF de la entrada a un resultado fiable.

13 artículos

Herramienta principal

PDF a Excel en línea

Abre la herramienta de este artículo y completa la operación en la localización actual.

Abrir herramienta

Tabla de contenidos

Cómo pasar tablas de un PDF a Excel

Un informe contiene una tabla y hay que recalcularla en vez de teclearla otra vez. La herramienta hace para eso más de lo que su nombre sugiere: no se limita a volcar texto, sino que arma un libro con varias hojas de distinta función. Entender cómo está construido ese libro compensa antes del primer intento.

Qué hay realmente en el archivo descargado

El resultado no es una hoja de datos. Es un libro cuyas hojas cumplen papeles distintos.

HojaQué contiene
ContenidoUn índice de páginas con enlaces a las demás hojas
TextoEl texto del documento, una fila por página
Página NUna imagen de la página completa del PDF
Tabla N.MUna tabla detectada convertida en celdas reales

La última fila es el objeto de todo el ejercicio. Las hojas de tablas contienen datos sobre los que se pueden poner fórmulas. Las imágenes de página y la hoja de texto son el seguro por si alguna tabla no se detectó: el contenido queda a la vista de todas formas.

La hoja de contenido funciona como un índice: el número de página, un enlace a su hoja y la primera línea de su texto para orientarse. Los enlaces saltan dentro del propio libro.

Tres modos de detección

El parámetro de detección cambia cómo busca la herramienta los bordes de las celdas, y eso cambia el resultado más que cualquier otra cosa.

ModoCómo encuentra la tablaQué contiene el libro
AutomáticoPor las líneas de la cuadrículaTodas las hojas, incluida la de texto
EstrictoPor líneas, con exigencias duras sobre cómo se cruzanNinguna hoja de texto
FlexiblePor dónde se sitúa el texto, sin apoyarse en líneasTodas las hojas, y el texto completo de la página en un comentario de celda

El automático es el predeterminado. El estricto se diferencia de él en algo más que su tiquismiquis con las líneas: elimina del libro la hoja de texto y deja solo tablas e imágenes. Tiene sentido cuando el resultado alimenta otro proceso y las hojas de más estorban.

El flexible es el único modo que ve tablas sin cuadrícula. Eso se paga, y el precio es alto.

Tiene además un efecto secundario que a veces resulta más útil que su función principal: en modo flexible el texto entero de la página aterriza también en un comentario adjunto a la primera celda de la hoja con la imagen. Pasando el cursor por encima se lee el contenido de la página sin cambiar a la hoja de texto.

Qué mostró la medición

El sujeto fue un documento cuya primera página lleva dos tablas: una con líneas y otra sin ninguna, solo columnas alineadas.

El automático y el estricto encontraron solo la primera, y la trasladaron perfecta: tres filas, tres columnas, valores en su sitio.

El flexible encontró las dos, pero las reunió en una sola cuadrícula y de paso partió palabras entre columnas. La palabra «Region» se convirtió en dos celdas, «Re» y «gion». «North» pasó a ser «No» y «rth». El número 900 se separó en «9» y «00». Entre las filas de datos aparecieron filas vacías.

La conclusión práctica: empieza por el automático. Si no aparece ninguna tabla y el documento realmente carece de líneas, cambia al flexible, pero cuenta con tiempo para montarlo a mano. Da material, no un resultado terminado.

Y al revés: si la tabla del PDF está dibujada con líneas y el resultado sigue vacío, el modo no es el problema. Lo más probable es que el documento no tenga capa de texto.

Cómo pasar la tabla

1. Abre pdf-to-excel y sube el documento. 2. Deja la detección en automático para el primer intento. 3. Lanza el procesamiento y descarga el libro. 4. Abre la hoja de contenido y salta a las hojas de tablas. 5. Contrasta los números de un par de filas con la imagen de la página en la hoja vecina. 6. Si no salió ninguna tabla, repite en modo flexible.

El quinto punto existe precisamente porque la imagen de la página está en el mismo libro. Contrastar lo trasladado con el original nunca obliga a salir de Excel.

Celdas combinadas y ordenación

El interruptor de combinación viene activado. Afecta a las celdas que en la tabla original abarcan varias columnas: activado, las restaura como rangos combinados de verdad y reproduce el aspecto del original.

Desactivado, rompe esas celdas en corrientes: el valor se queda en la primera y las demás quedan vacías.

Elige según lo que pienses hacer con los datos.

Si la tabla se va a leer y a imprimir, deja la combinación activada: el resultado coincide con el original.

Si los datos se van a ordenar, filtrar o llevar a una tabla dinámica, desactívala. Excel se niega a ordenar un rango con celdas combinadas y exige que todas tengan el mismo tamaño. Deshacer las combinaciones a mano después lleva más tiempo que mover el interruptor antes.

Por qué el archivo pesa más de lo esperado

Cada página del PDF entra en el libro como hoja propia con una imagen a tamaño completo, dibujada con casi el doble de resolución. Esas imágenes son casi todo el peso del resultado.

En un documento de prueba pequeño la diferencia se ve especialmente bien: el PDF de origen pesaba 2 KB y el libro salió en torno a 45 KB. En informes reales la cuenta va en megabytes, y crece con el número de páginas y no con el de tablas.

Si solo importan los datos y las imágenes estorban, las hojas sobrantes se borran en Excel en un par de movimientos, y el archivo adelgaza al guardarlo.

Un escaneo y una tabla sin capa de texto

La herramienta lee texto, no lo reconoce. Una tabla escaneada es una imagen para ella: la imagen de la página estará en el libro, la hoja de texto saldrá vacía y ningún modo encontrará tablas.

El remedio va antes de la conversión: pasa el archivo por ocr-pdf, consigue una capa de texto y conviértelo después a hoja de cálculo. El orden inverso no sirve, porque ya no queda nada que Excel pueda reconocer.

El mismo truco ayuda con documentos cuyo texto existe pero está torcido: una página tomada en ángulo se reconoce peor que una recta, y enderezarla antes del reconocimiento cambia el resultado de forma apreciable.

Límites, avisos y herramientas vecinas

Si la detección de tablas falla en alguna página, la tarea no se cae. El libro llega entero y la respuesta lleva un aviso con los números de esas páginas: de ellas no saldrán tablas, la imagen y el texto se quedan. Lo mismo para las páginas cuyo texto no se pudo leer.

Un documento con contraseña de apertura no se puede procesar; quita la protección con unlock-pdf. Una contraseña que solo limita la impresión o la copia no estorba a la extracción de tablas.

Cuando una página lleva varias tablas, cada una recibe su hoja, nombrada por el número de página y la posición de la tabla en ella. Excel limita la longitud de los nombres de hoja, así que las etiquetas largas se recortan y las coincidencias se separan con un sufijo numérico.

Si lo que necesitas del documento es texto para editar y no tablas, eso es pdf-to-word en modo fluido: allí el mismo detector las traslada como tablas de Word auténticas. Y devolver el libro terminado a PDF es cosa de excel-to-pdf.

FAQ

Primero comprueba si la tabla tiene líneas: los modos automático y estricto buscan los bordes de celda a lo largo de las líneas. Una tabla sin ellas solo la ve el modo flexible. Si las líneas están y el resultado sigue vacío, lo más probable es que falte la capa de texto y haga falta OCR.
Se apoya en dónde está el texto y no en las líneas, y en la medición partió palabras entre columnas: Region se convirtió en Re y gion, y el número 900 se separó en 9 y 00. Da material para montar a mano, no una tabla terminada.
Por las celdas combinadas: el interruptor de combinación viene activado y restaura las celdas que abarcaban varias columnas. Si los datos se van a ordenar o a llevar a una tabla dinámica, desactívalo antes de procesar.
Cada página del PDF entra en él como hoja propia con una imagen a tamaño completo. Esas imágenes son casi todo el peso. Si solo importan los datos, las hojas sobrantes se borran en Excel y el archivo adelgaza al guardarlo.
Los archivos se usan solo para la operación elegida y se eliminan automáticamente al terminar el procesamiento. No usamos los documentos subidos para entrenar modelos de IA.

Más de este cluster

Herramientas relacionadas

← Todas las herramientas de Convertir

Qué hacer después

Si después de leer necesitas el siguiente paso práctico o más contexto sobre el servicio, abre estas páginas.

Todas las herramientas

Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.

FAQ

Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.

Contacto

Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.