Zum Inhalt springen
Artikel

Tabellen aus PDF in Excel holen

PDF nach Excel: welche Blätter in der heruntergeladenen Mappe landen, worin sich die drei Erkennungsarten in der Praxis unterscheiden und warum die lockere Art mehr Tabellen findet, dabei aber Wörter zerbricht.

Kurz gesagt: Um Tabellen aus einer PDF nach Excel zu holen, öffnen Sie pdf-to-excel und lassen die Erkennung auf automatisch. Die Mappe enthält ein Inhaltsblatt, ein Textblatt, ein Bild jeder Seite und für jede gefundene Tabelle ein eigenes Blatt aus echten Zellen.

Cluster

Schritt-für-Schritt-Anleitung

Schritt-für-Schritt-Anleitungen, um eine PDF-Aufgabe von der Eingabe zum Ergebnis zu bringen.

13 Artikel

Primäres Tool

PDF in Excel online

Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.

Tool öffnen

Inhaltsverzeichnis

Tabellen aus einer PDF nach Excel holen

In einem Bericht steht eine Tabelle, und sie soll neu gerechnet und nicht abgetippt werden. Das Werkzeug tut dafür mehr, als sein Name vermuten lässt: es kippt nicht bloß Text aus, es baut eine Arbeitsmappe aus mehreren Blättern mit verschiedenen Aufgaben. Zu wissen, wie diese Mappe aufgebaut ist, lohnt sich vor dem ersten Lauf.

Was tatsächlich in der heruntergeladenen Datei steckt

Das Ergebnis ist kein einzelnes Datenblatt. Es ist eine Mappe, deren Blätter unterschiedliche Rollen spielen.

BlattWas darauf steht
InhaltEin Seitenverzeichnis mit Verweisen auf die übrigen Blätter
TextDer Text des Dokuments, eine Zeile je Seite
Seite NEin Bild der ganzen PDF-Seite
Tabelle N.MEine erkannte Tabelle als echte Zellen

Um die letzte Zeile geht die ganze Übung. Die Tabellenblätter tragen Daten, auf die sich Formeln setzen lassen. Die Seitenbilder und das Textblatt sind die Rückversicherung für den Fall, dass eine Tabelle nicht erkannt wurde: der Inhalt bleibt so oder so vor Augen.

Das Inhaltsblatt funktioniert wie ein Verzeichnis: die Seitenzahl, ein Verweis auf das Blatt dieser Seite und die erste Zeile ihres Textes zur Orientierung. Die Verweise springen innerhalb der Mappe.

Drei Erkennungsarten

Der Erkennungsparameter ändert, wie das Werkzeug nach Zellgrenzen sucht, und das verändert das Ergebnis stärker als alles andere.

ArtWie sie die Tabelle findetWas die Mappe enthält
AutomatischAn den Linien des RastersAlle Blätter, das Textblatt eingeschlossen
StrengAn Linien, mit harten Anforderungen an ihre KreuzungenGar kein Textblatt
LockerAn der Lage des Textes, ohne sich auf Linien zu stützenAlle Blätter, dazu der ganze Seitentext in einem Zellkommentar

Voreingestellt ist automatisch. Streng unterscheidet sich davon in mehr als der Pingeligkeit gegenüber Linien: es wirft das Textblatt aus der Mappe und lässt nur Tabellen und Bilder übrig. Das ist sinnvoll, wenn das Ergebnis weiterverarbeitet wird und überzählige Blätter stören.

Locker ist die einzige Art, die Tabellen ohne Linien sieht. Das wird bezahlt, und der Preis ist hoch.

Sie hat außerdem einen Nebeneffekt, der manchmal nützlicher ist als ihr Hauptzweck: in der lockeren Art landet der gesamte Text der Seite zusätzlich in einem Kommentar an der ersten Zelle des Bildblattes. Mit dem Zeiger darüber liest man den Seiteninhalt, ohne aufs Textblatt zu wechseln.

Was die Messung ergab

Genommen wurde ein Dokument, dessen erste Seite zwei Tabellen trägt: eine mit Linien, die andere ohne, nur ausgerichtete Spalten.

Automatisch und streng fanden nur die erste und übertrugen sie makellos: drei Zeilen, drei Spalten, Werte am Platz.

Locker fand beide, fasste sie aber zu einem Raster zusammen und zerbrach unterwegs Wörter über Spalten hinweg. Aus dem Wort „Region“ wurden zwei Zellen, „Re“ und „gion“. „North“ wurde zu „No“ und „rth“. Die Zahl 900 zerfiel in „9“ und „00“. Zwischen den Datenzeilen tauchten Leerzeilen auf.

Der praktische Schluss: fangen Sie automatisch an. Wird keine Tabelle gefunden und hat das Dokument wirklich keine Linien, wechseln Sie auf locker, planen Sie aber Zeit fürs Zusammensetzen von Hand ein. Es liefert Material, kein fertiges Ergebnis.

Und umgekehrt: ist die Tabelle in der PDF mit Linien gezeichnet und das Ergebnis bleibt trotzdem leer, liegt es nicht an der Art. Höchstwahrscheinlich hat das Dokument keine Textebene.

So holen Sie die Tabelle herüber

1. Öffnen Sie pdf-to-excel und laden Sie das Dokument hoch. 2. Lassen Sie die Erkennung für den ersten Versuch auf automatisch. 3. Starten Sie die Verarbeitung und laden Sie die Mappe herunter. 4. Öffnen Sie das Inhaltsblatt und springen Sie zu den Tabellenblättern. 5. Gleichen Sie die Zahlen in ein paar Zeilen mit dem Seitenbild auf dem Nachbarblatt ab. 6. Kam keine Tabelle zustande, wiederholen Sie es in der lockeren Art.

Punkt fünf gibt es gerade deshalb, weil das Seitenbild in derselben Mappe liegt. Das Übertragene mit dem Original abzugleichen verlangt nie, Excel zu verlassen.

Verbundene Zellen und das Sortieren

Der Schalter zum Zusammenführen ist voreingestellt an. Er betrifft Zellen, die in der Ausgangstabelle über mehrere Spalten reichen: eingeschaltet stellt er sie als echte verbundene Bereiche wieder her und gibt das Aussehen des Originals wieder.

Ausgeschaltet zerlegt er solche Zellen in gewöhnliche: der Wert bleibt in der ersten, die übrigen werden leer.

Wählen Sie danach, was Sie mit den Daten vorhaben.

Wird die Tabelle gelesen und gedruckt, lassen Sie das Zusammenführen an: das Ergebnis stimmt mit dem Original überein.

Werden die Daten sortiert, gefiltert oder in eine Pivot-Tabelle gebracht, schalten Sie es aus. Excel weigert sich, einen Bereich mit verbundenen Zellen zu sortieren, und verlangt, dass alle dieselbe Größe haben. Verbindungen hinterher von Hand aufzulösen dauert länger, als den Schalter vorher umzulegen.

Warum die Datei schwerer ist als erwartet

Jede PDF-Seite kommt als eigenes Blatt mit einem Bild in voller Größe in die Mappe, gerendert mit fast doppelter Auflösung. Diese Bilder machen beinahe das ganze Gewicht des Ergebnisses aus.

An einem kleinen Testdokument fällt der Unterschied besonders auf: die Ausgangs-PDF wog 2 KB, die Mappe kam auf rund 45 KB. Bei echten Berichten geht die Rechnung in Megabyte, und sie wächst mit der Zahl der Seiten und nicht mit der Zahl der Tabellen.

Zählen nur die Daten und stören die Bilder, löscht man die überzähligen Blätter in Excel mit ein paar Handgriffen, und die Datei wird beim Speichern schlanker.

Ein Scan und eine Tabelle ohne Textebene

Das Werkzeug liest Text, es erkennt ihn nicht. Eine eingescannte Tabelle ist für es ein Bild: das Seitenbild steht in der Mappe, das Textblatt bleibt leer, und keine Art findet Tabellen.

Die Abhilfe liegt vor der Umwandlung: schicken Sie die Datei durch ocr-pdf, holen Sie sich eine Textebene und wandeln Sie erst danach in eine Tabelle. Die umgekehrte Reihenfolge nützt nichts, denn für Excel bleibt nichts mehr zu erkennen.

Derselbe Kniff hilft bei Dokumenten, deren Text zwar da, aber schief ist: eine schräg aufgenommene Seite wird schlechter erkannt als eine gerade, und sie vor der Erkennung zu begradigen ändert das Ergebnis spürbar.

Grenzen, Hinweise und die Nachbarwerkzeuge

Scheitert die Tabellenerkennung auf einer Seite, bricht die Aufgabe nicht ab. Die Mappe kommt vollständig, und die Antwort trägt einen Hinweis mit den Nummern dieser Seiten: Tabellen wird es von dort keine geben, Bild und Text bleiben. Dasselbe gilt für Seiten, deren Text nicht gelesen werden konnte.

Ein Dokument mit Öffnungskennwort lässt sich nicht verarbeiten; nehmen Sie den Schutz mit unlock-pdf ab. Ein Kennwort, das nur Drucken oder Kopieren einschränkt, stört die Tabellenübernahme nicht.

Trägt eine Seite mehrere Tabellen, bekommt jede ihr eigenes Blatt, benannt nach der Seitenzahl und der Stellung der Tabelle darauf. Excel begrenzt die Länge von Blattnamen, lange Beschriftungen werden also gekürzt und Gleichnamigkeiten mit einer angehängten Zahl getrennt.

Brauchen Sie aus dem Dokument Text zum Bearbeiten und keine Tabellen, ist das pdf-to-word im fließenden Modus: dort trägt derselbe Erkenner sie als echte Word-Tabellen hinüber. Und die fertige Mappe zurück in eine PDF bringt excel-to-pdf.

Häufige Fragen

Prüfen Sie zuerst, ob die Tabelle Linien hat: automatisch und streng suchen die Zellgrenzen entlang der Linien. Eine Tabelle ohne Linien sieht nur die lockere Art. Sind Linien da und bleibt das Ergebnis leer, fehlt dem Dokument höchstwahrscheinlich die Textebene und es braucht OCR.
Sie stützt sich auf die Lage des Textes statt auf Linien und zerbrach in der Messung Wörter über Spalten: aus Region wurden Re und gion, die Zahl 900 zerfiel in 9 und 00. Sie liefert Material zum Zusammensetzen von Hand, keine fertige Tabelle.
Wegen der verbundenen Zellen: der Schalter zum Zusammenführen ist voreingestellt an und stellt Zellen wieder her, die über mehrere Spalten reichten. Sollen die Daten sortiert oder in eine Pivot-Tabelle gebracht werden, schalten Sie ihn vor der Verarbeitung aus.
Jede PDF-Seite kommt als eigenes Blatt mit einem Bild in voller Größe hinein. Diese Bilder machen fast das ganze Gewicht aus. Zählen nur die Daten, löscht man die überzähligen Blätter in Excel, und die Datei wird beim Speichern schlanker.
Dateien werden nur für den gewählten Vorgang verwendet und nach Abschluss der Verarbeitung automatisch gelöscht. Wir nutzen hochgeladene Dokumente nicht zum Training von KI-Modellen.

Mehr aus diesem Cluster

Verwandte Tools

← Alle Tools: Konvertieren

Was als Nächstes sinnvoll ist

Wenn Sie nach dem Lesen den nächsten praktischen Schritt oder mehr Orientierung zum Dienst brauchen, öffnen Sie diese Seiten.

Alle Tools

PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.

FAQ

Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.

Kontakt

Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.