Tabellen aus PDF in Excel holen
Kurz gesagt: Um Tabellen aus einer PDF nach Excel zu holen, öffnen Sie pdf-to-excel und lassen die Erkennung auf automatisch. Die Mappe enthält ein Inhaltsblatt, ein Textblatt, ein Bild jeder Seite und für jede gefundene Tabelle ein eigenes Blatt aus echten Zellen.
Cluster
Schritt-für-Schritt-Anleitung
Schritt-für-Schritt-Anleitungen, um eine PDF-Aufgabe von der Eingabe zum Ergebnis zu bringen.
Primäres Tool
PDF in Excel online
Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.
Tool öffnenInhaltsverzeichnis
Tabellen aus einer PDF nach Excel holen
In einem Bericht steht eine Tabelle, und sie soll neu gerechnet und nicht abgetippt werden. Das Werkzeug tut dafür mehr, als sein Name vermuten lässt: es kippt nicht bloß Text aus, es baut eine Arbeitsmappe aus mehreren Blättern mit verschiedenen Aufgaben. Zu wissen, wie diese Mappe aufgebaut ist, lohnt sich vor dem ersten Lauf.
Was tatsächlich in der heruntergeladenen Datei steckt
Das Ergebnis ist kein einzelnes Datenblatt. Es ist eine Mappe, deren Blätter unterschiedliche Rollen spielen.
| Blatt | Was darauf steht |
|---|---|
| Inhalt | Ein Seitenverzeichnis mit Verweisen auf die übrigen Blätter |
| Text | Der Text des Dokuments, eine Zeile je Seite |
| Seite N | Ein Bild der ganzen PDF-Seite |
| Tabelle N.M | Eine erkannte Tabelle als echte Zellen |
Um die letzte Zeile geht die ganze Übung. Die Tabellenblätter tragen Daten, auf die sich Formeln setzen lassen. Die Seitenbilder und das Textblatt sind die Rückversicherung für den Fall, dass eine Tabelle nicht erkannt wurde: der Inhalt bleibt so oder so vor Augen.
Das Inhaltsblatt funktioniert wie ein Verzeichnis: die Seitenzahl, ein Verweis auf das Blatt dieser Seite und die erste Zeile ihres Textes zur Orientierung. Die Verweise springen innerhalb der Mappe.
Drei Erkennungsarten
Der Erkennungsparameter ändert, wie das Werkzeug nach Zellgrenzen sucht, und das verändert das Ergebnis stärker als alles andere.
| Art | Wie sie die Tabelle findet | Was die Mappe enthält |
|---|---|---|
| Automatisch | An den Linien des Rasters | Alle Blätter, das Textblatt eingeschlossen |
| Streng | An Linien, mit harten Anforderungen an ihre Kreuzungen | Gar kein Textblatt |
| Locker | An der Lage des Textes, ohne sich auf Linien zu stützen | Alle Blätter, dazu der ganze Seitentext in einem Zellkommentar |
Voreingestellt ist automatisch. Streng unterscheidet sich davon in mehr als der Pingeligkeit gegenüber Linien: es wirft das Textblatt aus der Mappe und lässt nur Tabellen und Bilder übrig. Das ist sinnvoll, wenn das Ergebnis weiterverarbeitet wird und überzählige Blätter stören.
Locker ist die einzige Art, die Tabellen ohne Linien sieht. Das wird bezahlt, und der Preis ist hoch.
Sie hat außerdem einen Nebeneffekt, der manchmal nützlicher ist als ihr Hauptzweck: in der lockeren Art landet der gesamte Text der Seite zusätzlich in einem Kommentar an der ersten Zelle des Bildblattes. Mit dem Zeiger darüber liest man den Seiteninhalt, ohne aufs Textblatt zu wechseln.
Was die Messung ergab
Genommen wurde ein Dokument, dessen erste Seite zwei Tabellen trägt: eine mit Linien, die andere ohne, nur ausgerichtete Spalten.
Automatisch und streng fanden nur die erste und übertrugen sie makellos: drei Zeilen, drei Spalten, Werte am Platz.
Locker fand beide, fasste sie aber zu einem Raster zusammen und zerbrach unterwegs Wörter über Spalten hinweg. Aus dem Wort „Region“ wurden zwei Zellen, „Re“ und „gion“. „North“ wurde zu „No“ und „rth“. Die Zahl 900 zerfiel in „9“ und „00“. Zwischen den Datenzeilen tauchten Leerzeilen auf.
Der praktische Schluss: fangen Sie automatisch an. Wird keine Tabelle gefunden und hat das Dokument wirklich keine Linien, wechseln Sie auf locker, planen Sie aber Zeit fürs Zusammensetzen von Hand ein. Es liefert Material, kein fertiges Ergebnis.
Und umgekehrt: ist die Tabelle in der PDF mit Linien gezeichnet und das Ergebnis bleibt trotzdem leer, liegt es nicht an der Art. Höchstwahrscheinlich hat das Dokument keine Textebene.
So holen Sie die Tabelle herüber
1. Öffnen Sie pdf-to-excel und laden Sie das Dokument hoch. 2. Lassen Sie die Erkennung für den ersten Versuch auf automatisch. 3. Starten Sie die Verarbeitung und laden Sie die Mappe herunter. 4. Öffnen Sie das Inhaltsblatt und springen Sie zu den Tabellenblättern. 5. Gleichen Sie die Zahlen in ein paar Zeilen mit dem Seitenbild auf dem Nachbarblatt ab. 6. Kam keine Tabelle zustande, wiederholen Sie es in der lockeren Art.
Punkt fünf gibt es gerade deshalb, weil das Seitenbild in derselben Mappe liegt. Das Übertragene mit dem Original abzugleichen verlangt nie, Excel zu verlassen.
Verbundene Zellen und das Sortieren
Der Schalter zum Zusammenführen ist voreingestellt an. Er betrifft Zellen, die in der Ausgangstabelle über mehrere Spalten reichen: eingeschaltet stellt er sie als echte verbundene Bereiche wieder her und gibt das Aussehen des Originals wieder.
Ausgeschaltet zerlegt er solche Zellen in gewöhnliche: der Wert bleibt in der ersten, die übrigen werden leer.
Wählen Sie danach, was Sie mit den Daten vorhaben.
Wird die Tabelle gelesen und gedruckt, lassen Sie das Zusammenführen an: das Ergebnis stimmt mit dem Original überein.
Werden die Daten sortiert, gefiltert oder in eine Pivot-Tabelle gebracht, schalten Sie es aus. Excel weigert sich, einen Bereich mit verbundenen Zellen zu sortieren, und verlangt, dass alle dieselbe Größe haben. Verbindungen hinterher von Hand aufzulösen dauert länger, als den Schalter vorher umzulegen.
Warum die Datei schwerer ist als erwartet
Jede PDF-Seite kommt als eigenes Blatt mit einem Bild in voller Größe in die Mappe, gerendert mit fast doppelter Auflösung. Diese Bilder machen beinahe das ganze Gewicht des Ergebnisses aus.
An einem kleinen Testdokument fällt der Unterschied besonders auf: die Ausgangs-PDF wog 2 KB, die Mappe kam auf rund 45 KB. Bei echten Berichten geht die Rechnung in Megabyte, und sie wächst mit der Zahl der Seiten und nicht mit der Zahl der Tabellen.
Zählen nur die Daten und stören die Bilder, löscht man die überzähligen Blätter in Excel mit ein paar Handgriffen, und die Datei wird beim Speichern schlanker.
Ein Scan und eine Tabelle ohne Textebene
Das Werkzeug liest Text, es erkennt ihn nicht. Eine eingescannte Tabelle ist für es ein Bild: das Seitenbild steht in der Mappe, das Textblatt bleibt leer, und keine Art findet Tabellen.
Die Abhilfe liegt vor der Umwandlung: schicken Sie die Datei durch ocr-pdf, holen Sie sich eine Textebene und wandeln Sie erst danach in eine Tabelle. Die umgekehrte Reihenfolge nützt nichts, denn für Excel bleibt nichts mehr zu erkennen.
Derselbe Kniff hilft bei Dokumenten, deren Text zwar da, aber schief ist: eine schräg aufgenommene Seite wird schlechter erkannt als eine gerade, und sie vor der Erkennung zu begradigen ändert das Ergebnis spürbar.
Grenzen, Hinweise und die Nachbarwerkzeuge
Scheitert die Tabellenerkennung auf einer Seite, bricht die Aufgabe nicht ab. Die Mappe kommt vollständig, und die Antwort trägt einen Hinweis mit den Nummern dieser Seiten: Tabellen wird es von dort keine geben, Bild und Text bleiben. Dasselbe gilt für Seiten, deren Text nicht gelesen werden konnte.
Ein Dokument mit Öffnungskennwort lässt sich nicht verarbeiten; nehmen Sie den Schutz mit unlock-pdf ab. Ein Kennwort, das nur Drucken oder Kopieren einschränkt, stört die Tabellenübernahme nicht.
Trägt eine Seite mehrere Tabellen, bekommt jede ihr eigenes Blatt, benannt nach der Seitenzahl und der Stellung der Tabelle darauf. Excel begrenzt die Länge von Blattnamen, lange Beschriftungen werden also gekürzt und Gleichnamigkeiten mit einer angehängten Zahl getrennt.
Brauchen Sie aus dem Dokument Text zum Bearbeiten und keine Tabellen, ist das pdf-to-word im fließenden Modus: dort trägt derselbe Erkenner sie als echte Word-Tabellen hinüber. Und die fertige Mappe zurück in eine PDF bringt excel-to-pdf.
Häufige Fragen
Mehr aus diesem Cluster
Schritt-für-Schritt-Anleitung
PDF in bearbeitbares Word umwandeln
Die Datei öffnet sich in Word, aber der Cursor kommt nicht in den Text? Warum ab Werk ein Bild herauskommt, worin sich fließender und genauer Modus unterscheiden und wohin die Kopfzeilen verschwunden sind.
Schritt-für-Schritt-Anleitung
PDF-Seiten als eigene Datei speichern
Die gebrauchten Blätter als eigene Datei aus einer PDF holen: worin sich die beiden Ausgabearten unterscheiden, warum die Dateien im Archiv die ursprünglichen Seitenzahlen behalten und was das Abschalten der Größenbeibehaltung bewirkt.
Schritt-für-Schritt-Anleitung
PDF-Seiten zuschneiden: Ränder weg
Das Beschneiden ändert nur den sichtbaren Bereich der Seite, während der Inhalt dahinter in der Datei bleibt. Was das praktisch bedeutet, warum die Ränder für das ganze Dokument gelten und wie sich der Beschnitt auf gedrehten Seiten verhält.
Verwandte Tools
PDF in Excel online
Extrahieren Sie Tabellendaten aus einer PDF nach Excel, damit sie berechnet, gefiltert und sortiert werden können.
Excel in PDF online
Wandeln Sie eine Excel-Tabelle in PDF um, um ihr Aussehen festzuhalten und sie leicht zu drucken oder zu senden.
OCR-PDF online
OCR-PDF hält die PDF-Aufgabe in einem Browser-Ablauf: Quelldatei hochladen, Optionen prüfen, Verarbeitung starten und Ergebnis herunterladen.
PDF in Word online
Wandeln Sie eine PDF in ein Word-Dokument um, um den Text zu bearbeiten, Abschnitte zu erweitern und Änderungen vorzunehmen.
Was als Nächstes sinnvoll ist
Alle Tools
PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.
FAQ
Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.
Kontakt
Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.