Cómo extraer tablas de PDF a Excel
En resumen: Para pasar tablas de un PDF a Excel, abre pdf-to-excel y deja la detección en automático. El libro traerá una hoja de contenido, una de texto, una imagen de cada página y una hoja aparte de celdas reales por cada tabla encontrada.
Cluster
guía paso a paso
Instrucciones paso a paso para llevar una tarea PDF de la entrada a un resultado fiable.
Herramienta principal
PDF a Excel en línea
Abre la herramienta de este artículo y completa la operación en la localización actual.
Abrir herramientaTabla de contenidos
Cómo pasar tablas de un PDF a Excel
Un informe contiene una tabla y hay que recalcularla en vez de teclearla otra vez. La herramienta hace para eso más de lo que su nombre sugiere: no se limita a volcar texto, sino que arma un libro con varias hojas de distinta función. Entender cómo está construido ese libro compensa antes del primer intento.
Qué hay realmente en el archivo descargado
El resultado no es una hoja de datos. Es un libro cuyas hojas cumplen papeles distintos.
| Hoja | Qué contiene |
|---|---|
| Contenido | Un índice de páginas con enlaces a las demás hojas |
| Texto | El texto del documento, una fila por página |
| Página N | Una imagen de la página completa del PDF |
| Tabla N.M | Una tabla detectada convertida en celdas reales |
La última fila es el objeto de todo el ejercicio. Las hojas de tablas contienen datos sobre los que se pueden poner fórmulas. Las imágenes de página y la hoja de texto son el seguro por si alguna tabla no se detectó: el contenido queda a la vista de todas formas.
La hoja de contenido funciona como un índice: el número de página, un enlace a su hoja y la primera línea de su texto para orientarse. Los enlaces saltan dentro del propio libro.
Tres modos de detección
El parámetro de detección cambia cómo busca la herramienta los bordes de las celdas, y eso cambia el resultado más que cualquier otra cosa.
| Modo | Cómo encuentra la tabla | Qué contiene el libro |
|---|---|---|
| Automático | Por las líneas de la cuadrícula | Todas las hojas, incluida la de texto |
| Estricto | Por líneas, con exigencias duras sobre cómo se cruzan | Ninguna hoja de texto |
| Flexible | Por dónde se sitúa el texto, sin apoyarse en líneas | Todas las hojas, y el texto completo de la página en un comentario de celda |
El automático es el predeterminado. El estricto se diferencia de él en algo más que su tiquismiquis con las líneas: elimina del libro la hoja de texto y deja solo tablas e imágenes. Tiene sentido cuando el resultado alimenta otro proceso y las hojas de más estorban.
El flexible es el único modo que ve tablas sin cuadrícula. Eso se paga, y el precio es alto.
Tiene además un efecto secundario que a veces resulta más útil que su función principal: en modo flexible el texto entero de la página aterriza también en un comentario adjunto a la primera celda de la hoja con la imagen. Pasando el cursor por encima se lee el contenido de la página sin cambiar a la hoja de texto.
Qué mostró la medición
El sujeto fue un documento cuya primera página lleva dos tablas: una con líneas y otra sin ninguna, solo columnas alineadas.
El automático y el estricto encontraron solo la primera, y la trasladaron perfecta: tres filas, tres columnas, valores en su sitio.
El flexible encontró las dos, pero las reunió en una sola cuadrícula y de paso partió palabras entre columnas. La palabra «Region» se convirtió en dos celdas, «Re» y «gion». «North» pasó a ser «No» y «rth». El número 900 se separó en «9» y «00». Entre las filas de datos aparecieron filas vacías.
La conclusión práctica: empieza por el automático. Si no aparece ninguna tabla y el documento realmente carece de líneas, cambia al flexible, pero cuenta con tiempo para montarlo a mano. Da material, no un resultado terminado.
Y al revés: si la tabla del PDF está dibujada con líneas y el resultado sigue vacío, el modo no es el problema. Lo más probable es que el documento no tenga capa de texto.
Cómo pasar la tabla
1. Abre pdf-to-excel y sube el documento. 2. Deja la detección en automático para el primer intento. 3. Lanza el procesamiento y descarga el libro. 4. Abre la hoja de contenido y salta a las hojas de tablas. 5. Contrasta los números de un par de filas con la imagen de la página en la hoja vecina. 6. Si no salió ninguna tabla, repite en modo flexible.
El quinto punto existe precisamente porque la imagen de la página está en el mismo libro. Contrastar lo trasladado con el original nunca obliga a salir de Excel.
Celdas combinadas y ordenación
El interruptor de combinación viene activado. Afecta a las celdas que en la tabla original abarcan varias columnas: activado, las restaura como rangos combinados de verdad y reproduce el aspecto del original.
Desactivado, rompe esas celdas en corrientes: el valor se queda en la primera y las demás quedan vacías.
Elige según lo que pienses hacer con los datos.
Si la tabla se va a leer y a imprimir, deja la combinación activada: el resultado coincide con el original.
Si los datos se van a ordenar, filtrar o llevar a una tabla dinámica, desactívala. Excel se niega a ordenar un rango con celdas combinadas y exige que todas tengan el mismo tamaño. Deshacer las combinaciones a mano después lleva más tiempo que mover el interruptor antes.
Por qué el archivo pesa más de lo esperado
Cada página del PDF entra en el libro como hoja propia con una imagen a tamaño completo, dibujada con casi el doble de resolución. Esas imágenes son casi todo el peso del resultado.
En un documento de prueba pequeño la diferencia se ve especialmente bien: el PDF de origen pesaba 2 KB y el libro salió en torno a 45 KB. En informes reales la cuenta va en megabytes, y crece con el número de páginas y no con el de tablas.
Si solo importan los datos y las imágenes estorban, las hojas sobrantes se borran en Excel en un par de movimientos, y el archivo adelgaza al guardarlo.
Un escaneo y una tabla sin capa de texto
La herramienta lee texto, no lo reconoce. Una tabla escaneada es una imagen para ella: la imagen de la página estará en el libro, la hoja de texto saldrá vacía y ningún modo encontrará tablas.
El remedio va antes de la conversión: pasa el archivo por ocr-pdf, consigue una capa de texto y conviértelo después a hoja de cálculo. El orden inverso no sirve, porque ya no queda nada que Excel pueda reconocer.
El mismo truco ayuda con documentos cuyo texto existe pero está torcido: una página tomada en ángulo se reconoce peor que una recta, y enderezarla antes del reconocimiento cambia el resultado de forma apreciable.
Límites, avisos y herramientas vecinas
Si la detección de tablas falla en alguna página, la tarea no se cae. El libro llega entero y la respuesta lleva un aviso con los números de esas páginas: de ellas no saldrán tablas, la imagen y el texto se quedan. Lo mismo para las páginas cuyo texto no se pudo leer.
Un documento con contraseña de apertura no se puede procesar; quita la protección con unlock-pdf. Una contraseña que solo limita la impresión o la copia no estorba a la extracción de tablas.
Cuando una página lleva varias tablas, cada una recibe su hoja, nombrada por el número de página y la posición de la tabla en ella. Excel limita la longitud de los nombres de hoja, así que las etiquetas largas se recortan y las coincidencias se separan con un sufijo numérico.
Si lo que necesitas del documento es texto para editar y no tablas, eso es pdf-to-word en modo fluido: allí el mismo detector las traslada como tablas de Word auténticas. Y devolver el libro terminado a PDF es cosa de excel-to-pdf.
FAQ
Más de este cluster
guía paso a paso
Cómo pasar un PDF a Word editable
¿El archivo se abrió en Word pero el cursor no entra en el texto? Por qué de fábrica sale una imagen, en qué se diferencia el modo fluido del exacto y adónde fueron a parar los encabezados.
guía paso a paso
Extraer páginas de un PDF a otro archivo
Sacar de un PDF las hojas que necesitas como archivo aparte: en qué se diferencian los dos modos de salida, por qué los archivos del ZIP conservan los números de página originales y qué hace desactivar la conservación del tamaño.
guía paso a paso
Cómo recortar márgenes y sobras en un PDF
El recorte cambia solo el área visible de la página mientras el contenido de más allá sigue en el archivo. Qué significa eso en la práctica, por qué los márgenes se aplican a todo el documento y cómo se comporta el recorte en páginas giradas.
Herramientas relacionadas
PDF a Excel en línea
Extrae datos de tablas de un PDF a Excel para poder calcularlos, filtrarlos y ordenarlos.
Excel a PDF en línea
Convierte una hoja de Excel a PDF para fijar su aspecto e imprimirla o enviarla con facilidad.
PDF con OCR online
PDF con OCR mantiene la tarea PDF en un solo flujo del navegador: subir el archivo, revisar opciones, procesar y descargar el resultado.
PDF a Word en línea
Convierte un PDF a un documento Word para editar el texto, ampliar secciones y hacer cambios.
Qué hacer después
Todas las herramientas
Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.
FAQ
Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.
Contacto
Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.