PDF in bearbeitbares Word umwandeln
Kurz gesagt: Für ein wirklich bearbeitbares Word stellen Sie den Ergebnistyp in pdf-to-word auf fließend um: voreingestellt ist der genaue Modus, der jede Seite als Bild mit verborgener Suchebene einsetzt. Der fließende Modus baut Absätze, Überschriften und echte Word-Tabellen auf.
Cluster
Schritt-für-Schritt-Anleitung
Schritt-für-Schritt-Anleitungen, um eine PDF-Aufgabe von der Eingabe zum Ergebnis zu bringen.
Primäres Tool
PDF in Word online
Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.
Tool öffnenInhaltsverzeichnis
- Voreingestellt kommt ein Bild heraus, kein Text
- Was in der genauen Datei steckt
- So bekommen Sie ein Dokument, das sich bearbeiten lässt
- Kopf- und Fußzeilen verschwinden mit Absicht
- Überschriften entstehen aus der Schriftgröße
- Tabellen werden zu Tabellen
- Dateigewicht und Seitenvorschauen
- Ein Scan ohne Textebene
PDF in ein bearbeitbares Word umwandeln
Der Wunsch ist fast immer derselbe: in einem zugeschickten PDF sollen zwei Absätze korrigiert werden. Und der erste Versuch enttäuscht fast immer. Die Datei öffnet sich in Word, sieht perfekt aus, und der Cursor lässt sich nicht in den Text setzen. Das ist kein Umwandlungsfehler, sondern die Folge der Einstellung, die ab Werk gesetzt ist.
Voreingestellt kommt ein Bild heraus, kein Text
Das Werkzeug hat zwei Modi, und der Umschalter dazwischen heißt Ergebnistyp. Vorausgewählt ist der genaue, und er tut genau das, was er verspricht: er bewahrt das Aussehen der Seite Buchstabe für Buchstabe. Das Verfahren dahinter ist grob. Jede PDF-Seite wird zu einem Bild gerendert und als Ganzes ins Word-Dokument gesetzt.
Daher das Gefühl, vertauscht worden zu sein. Es ist ein .docx, es öffnet sich in Word, die Seiten stimmen in Größe und Ausrichtung mit dem Original überein, und zu bearbeiten gibt es nichts: auf der Seite liegen Bilder.
Der zweite Modus, der fließende, zerlegt die Seite und baut aus den Teilen ein echtes Word-Dokument: Absätze, Überschriften, Listen und Tabellen. Aufgegeben wird dafür die genaue Anordnung auf der Seite.
| Modus | Was darin steckt | Was möglich ist |
|---|---|---|
| Genau | Ein Bild jeder Seite plus eine verborgene Textebene | Lesen, im Text suchen, drucken |
| Fließend | Word-Absätze, Überschriften, Listen und Tabellen | Text bearbeiten, Formate ändern, mit Tabellen arbeiten |
Die Wahl geht nicht um Qualität, sondern um die Aufgabe. Ein Dokument, das im gewohnten Bürodateiformat weiterwandern und unangetastet bleiben soll, will den genauen Modus. Ein Dokument, das sich ändern soll, will den fließenden, und keine Einstellung des genauen Modus führt zu bearbeitbarem Text.
Was in der genauen Datei steckt
Das Seitenbild ist nicht der ganze Inhalt. Darunter kommt zusätzlich der aus dem PDF gelesene Text, als verborgen markiert: am Bildschirm und im Druck fehlt er, die Suche im Dokument findet ihn aber.
Das macht den genauen Modus dort sinnvoll, wo er nutzlos wirkt. Ein Vertrag, der verteilt und später nach Formulierungen durchsucht wird, funktioniert so gut: das Aussehen bleibt, die Suche greift, versehentliche Änderungen gibt es nicht. Das Werkzeug sagt es nach der Verarbeitung selbst und weist darauf hin, dass das Dokument kein bearbeitbarer Text ist; diese Meldung sollte man lesen statt wegzuklicken.
Seitengröße und Ausrichtung stammen Seite für Seite aus dem Quell-PDF. Ein Querformatblatt mitten in einem Hochformatdokument bleibt quer.
So bekommen Sie ein Dokument, das sich bearbeiten lässt
1. Öffnen Sie pdf-to-word und laden Sie die Datei hoch. 2. Stellen Sie den Ergebnistyp auf fließend um. Das ist die entscheidende Handlung, und voreingestellt ist sie nicht. 3. Entscheiden Sie über die Seitenvorschauen, dazu weiter unten mehr, und schalten Sie sie bei Bedarf ab. 4. Starten Sie die Verarbeitung und laden Sie die .docx herunter. 5. Öffnen Sie das Dokument und gehen Sie den Navigationsbereich durch: er zeigt, welche Überschriften erkannt wurden. 6. Prüfen Sie die Tabellen und die erste Seite, dort fallen Verluste am ehesten auf.
Kopf- und Fußzeilen verschwinden mit Absicht
Der fließende Modus macht einen eigenen Durchgang durch das ganze Dokument und sucht nach wiederkehrenden Zeilen. Zwei Bedingungen gelten: die Zeile muss im oberen oder unteren Zehntel der Seite liegen und sich auf mindestens drei Seiten sowie auf mindestens der Hälfte des Dokuments wiederholen. Alles, was beides erfüllt, fliegt aus dem Ergebnis.
Der Vergleich ist dabei nicht naiv. Ziffernfolgen werden zusammengezogen, „Seite 4“ und „Seite 5“ gelten also als dieselbe Zeile. Das Zusammenziehen greift aber nur, wenn Buchstaben übrig bleiben: eine nackte Zahl am Fuß wird exakt verglichen, und drei verschiedene Ziffern auf drei Seiten sind einander nicht gleich. In der Praxis fällt eine Fußzeile „Vertraulich. Seite 7“ weg, während eine Fußzeile aus einer bloßen Ziffer als Absatz auf jeder Seite stehen bleibt.
An einem vierseitigen Bericht geprüft: die Zeile `Confidential report Page N` fehlt im fließenden Ergebnis und steht im genauen, wo die Seite ohnehin ein Bild ist und sich nichts daraus entfernen lässt.
Der Mechanismus hat auch eine Kehrseite. Ein Dokumenttitel, groß ganz oben auf jeder Seite und überall gleich, fällt unter dieselbe Regel und wird zusammen mit den Kopfzeilen gelöscht. Ist diese oberste Zeile wichtig, ist sie schneller neu getippt als die Ursache gesucht.
Überschriften entstehen aus der Schriftgröße
Die Überschriftenformate im Ergebnis werden nicht erfunden. Das Werkzeug ermittelt zuerst dokumentweit, welche Schriftgröße die Grundschrift ist. Gezählt werden Zeichen und nicht Zeilen, eine seltene große Zeile gewinnt die Abstimmung also nie.
Danach wird jeder Block an dieser Größe gemessen. Etwa 15 Prozent größer als die Grundschrift ergibt eine Überschrift zweiter Ebene, das Anderthalbfache und mehr die erste Ebene. Alles andere bleibt gewöhnlicher Absatz. Der Text muss zusätzlich wie eine Überschrift aussehen: ein langer Satz mit Punkt am Ende wird keine, in welcher Schrift auch immer.
Daraus folgt ein vorhersagbares Verhalten bei Dokumenten ohne Formatvorlagen. Ist der ganze Text in einem Grad gesetzt und sind die Abschnitte nur fett hervorgehoben, hat die Word-Datei gar keine Überschriften: die Größe unterscheidet sich nicht, es gibt nichts, woran man sich halten könnte. Der Navigationsbereich bleibt leer und die Struktur muss von Hand entstehen.
Tabellen werden zu Tabellen
Tabellen findet ein eigener Erkenner, derselbe, auf dem pdf-to-excel aufsetzt. Eine erkannte Tabelle landet als echte Word-Tabelle mit sichtbarem Gitter im Dokument und nicht als mit Leerzeichen aufgefüllte Absätze.
Textblöcke, die innerhalb der Grenzen einer erkannten Tabelle liegen, fallen aus dem Absatzstrom heraus; sonst stünde der Zelleninhalt zweimal da, einmal als Tabelle und einmal als Fließtext. Die Schwelle liegt bei sechs Zehnteln der Blockfläche.
Wo die Tabelle landet, entscheidet ihre Oberkante: sie wird vor dem ersten Absatz eingefügt, der unterhalb von ihr beginnt. Auf einer gewöhnlichen einspaltigen Seite ergibt das die richtige Reihenfolge. Auf einer zweispaltigen Seite kann die Tabelle woanders landen, weil die Absätze beider Spalten in der Datei nacheinander stehen, ihre Höhen sich aber verschränken.
Scheitert die Tabellenerkennung auf einer Seite, bricht die Aufgabe nicht ab: diese Seite kommt als gewöhnlicher Text durch, und die Antwort trägt einen Hinweis mit den Seitenzahlen. Eine stumme leere Antwort ist hier nicht möglich.
Dateigewicht und Seitenvorschauen
Der fließende Modus hängt voreingestellt hinter den Text jeder Seite ein Bild dieser Seite, damit es etwas zum Abgleichen gibt. Nichts sonst wirkt so stark auf das Gewicht.
An ein und demselben vierseitigen Dokument gemessen:
| Ergebnis | Größe |
|---|---|
| Genauer Modus | 671 KB |
| Fließend mit Seitenvorschauen | 315 KB |
| Fließend ohne Vorschauen | 37 KB |
Das Quell-PDF wog etwa 4 KB. Der Abstand zwischen den äußeren Zeilen beträgt das Achtzehnfache, und er besteht ganz aus Bildern. Geht das Dokument in echte Arbeit und nicht in einen Abgleich, schalten Sie die Vorschauen gleich ab: sie lassen sich nicht bearbeiten, gehören nicht zum Text und stören beim Korrekturlesen.
Der genaue Modus beachtet diese Einstellung gar nicht, seine Seite ist ohnehin ein Bild.
Ein Scan ohne Textebene
Ein gescanntes Dokument ist ein Bild, herauszuholen gibt es daraus nichts. Im genauen Modus ist das Ergebnis derselbe Scan, neu verpackt als .docx. Im fließenden Modus kommen die Seiten leer heraus, mit einem Vermerk anstelle jeder Seite, dass sie leer war.
Die Abhilfe liegt vor der Umwandlung, nicht danach: schicken Sie die Datei durch ocr-pdf, holen Sie sich ein PDF mit Textebene und wandeln Sie erst dieses nach Word. Die umgekehrte Reihenfolge funktioniert nicht, weil dann nichts mehr da ist, worauf die Erkennung ansetzen könnte.
Ein mit Öffnungskennwort verschlossenes Dokument wandelt ebenfalls nicht; die Aufgabe hält an und verlangt das Kennwort. Nehmen Sie den Schutz mit unlock-pdf ab. Ein Kennwort, das nur Drucken oder Kopieren einschränkt, stört nicht.
Sind die Änderungen drin, muss das Dokument meist zurück ins PDF. Dafür gibt es word-to-pdf, mit einem eigenen Verhalten beim Ersetzen von Schriften, das man vorher kennen sollte.
Häufige Fragen
Mehr aus diesem Cluster
Schritt-für-Schritt-Anleitung
Tabellen aus PDF in Excel holen
PDF nach Excel: welche Blätter in der heruntergeladenen Mappe landen, worin sich die drei Erkennungsarten in der Praxis unterscheiden und warum die lockere Art mehr Tabellen findet, dabei aber Wörter zerbricht.
Schritt-für-Schritt-Anleitung
PDF-Seiten als eigene Datei speichern
Die gebrauchten Blätter als eigene Datei aus einer PDF holen: worin sich die beiden Ausgabearten unterscheiden, warum die Dateien im Archiv die ursprünglichen Seitenzahlen behalten und was das Abschalten der Größenbeibehaltung bewirkt.
Schritt-für-Schritt-Anleitung
PDF-Seiten zuschneiden: Ränder weg
Das Beschneiden ändert nur den sichtbaren Bereich der Seite, während der Inhalt dahinter in der Datei bleibt. Was das praktisch bedeutet, warum die Ränder für das ganze Dokument gelten und wie sich der Beschnitt auf gedrehten Seiten verhält.
Verwandte Tools
PDF in Word online
Wandeln Sie eine PDF in ein Word-Dokument um, um den Text zu bearbeiten, Abschnitte zu erweitern und Änderungen vorzunehmen.
Word in PDF online
Wandeln Sie ein Word-Dokument in PDF um, um das Layout festzuhalten und sicherzugehen, dass die Datei überall gleich öffnet.
PDF in Excel online
Extrahieren Sie Tabellendaten aus einer PDF nach Excel, damit sie berechnet, gefiltert und sortiert werden können.
OCR-PDF online
OCR-PDF hält die PDF-Aufgabe in einem Browser-Ablauf: Quelldatei hochladen, Optionen prüfen, Verarbeitung starten und Ergebnis herunterladen.
Was als Nächstes sinnvoll ist
Alle Tools
PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.
FAQ
Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.
Kontakt
Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.