Text in einem gescannten PDF per OCR erkennen
Kurz gesagt: Um Text in einem gescannten PDF erkennbar zu machen, lassen Sie es durch OCR laufen: Danach wird das Dokument markierbar und durchsuchbar. Die Qualität hängt vom Scan ab; bei Handschrift ist OCR unzuverlässig.
Cluster
Schritt-für-Schritt-Anleitung
Schritt-für-Schritt-Anleitungen, um eine PDF-Aufgabe von der Eingabe zum Ergebnis zu bringen.
Primäres Tool
OCR-PDF online
Öffnen Sie das Tool aus diesem Artikel und führen Sie den Vorgang in der aktuellen Sprache aus.
Tool öffnenInhaltsverzeichnis
Sie erhalten ein PDF mit einem gescannten Vertrag, Zertifikat oder Formular. Sie versuchen, Text zu markieren, und nichts passiert: Der Cursor verhält sich, als wäre die Seite ein Bild. Genau das ist sie auch, ein gescanntes Bild ohne darunterliegende Textebene. OCR (optische Zeichenerkennung) fügt diese Ebene hinzu und macht aus dem Bild ein Dokument, in dem Text markiert, kopiert und durchsucht werden kann.
Wann Sie OCR brauchen
OCR ist nützlich, wenn Sie ein gescanntes PDF haben und eine Passage kopieren möchten, ohne sie abzutippen, ein Wort mit Strg+F suchen, den Inhalt ohne Neueingabe in ein anderes Werkzeug übernehmen oder ein archiviertes Dokument per Stichwort auffindbar machen wollen. Hat das PDF bereits eine Textebene – Sie können also Wörter markieren – wird kein OCR benötigt.
Wovon die Qualität abhängt
Die Qualität des Ergebnisses hängt fast vollständig vom Ausgangsscan ab. Wichtig sind die Auflösung (mindestens 150–200 dpi, ideal 300), die Ausrichtung der Seite (stark geneigter Text wird schlecht erkannt), Beleuchtung und Kontrast (Schatten vom Buchrücken oder vergilbtes Papier senken die Genauigkeit) sowie die Sprache des Textes, die der Algorithmus zur richtigen Deutung der Buchstaben kennen muss.
OCR ausführen, Schritt für Schritt
1. Öffnen Sie das Werkzeug ocr-pdf und laden Sie Ihr gescanntes PDF hoch. 2. Wählen Sie die Sprache des Dokuments, falls Sie danach gefragt werden. 3. Warten Sie auf die Verarbeitung: Mehrseitige Scans dauern länger. 4. Laden Sie das Ergebnis herunter. 5. Öffnen Sie es und prüfen Sie: Lässt sich Text markieren? Werden Namen, Daten und Zahlen korrekt erkannt?
Was schiefgehen kann
- Viele Fehler bei Namen und Zahlen. Die Scanqualität ist zu niedrig. Scannen oder fotografieren Sie mit höherer Auflösung neu.
- Es wird gar kein Text erkannt. Das PDF kann Vektorgrafiken enthalten, die wie ein Scan aussehen, es aber nicht sind; OCR hilft dort nicht.
- Die Datei ist viel größer geworden. OCR fügt eine Textebene hinzu und erhöht das Gewicht leicht; ist sie zu schwer, komprimieren Sie sie mit compress-pdf.
- Handschrift ist nicht lesbar. Standard-OCR zielt auf gedruckten Text; Unterschriften und Randnotizen werden schlecht oder gar nicht erkannt.
Was Sie nach dem OCR prüfen sollten
- Markieren Sie einige Zeilen und fügen Sie sie in einen Editor ein, um den Text zu bestätigen.
- Suchen Sie Stichwörter mit Strg+F: einen Namen, eine Organisation, ein Datum.
- Vergleichen Sie Zahlen und Daten im erkannten Text mit dem Original; dort liegen die häufigsten Fehler.
Fazit
Um ein gescanntes PDF durchsuchbar und markierbar zu machen, laden Sie es in ocr-pdf. Bei langen Dokumenten teilen Sie die Datei zuerst mit split-pdf, verarbeiten die Teile getrennt und führen die Ergebnisse mit merge-pdf zusammen.
Häufige Fragen
Mehr aus diesem Cluster
Schritt-für-Schritt-Anleitung
PDF in bearbeitbares Word umwandeln
PDF in ein bearbeitbares Word-Dokument umwandeln: Tabellen und Layout erhalten, mit Scans und Spalten umgehen, das Ergebnis richtig prüfen.
Schritt-für-Schritt-Anleitung
Tabellen aus PDF in Excel holen
So holen Sie Tabellen aus einem PDF nach Excel: Schritt für Schritt, was bei Scans, verrutschten Spalten und verbundenen Zellen zu tun ist und wie Sie das Ergebnis vor der Arbeit mit Zahlen prüfen.
Schritt-für-Schritt-Anleitung
PDF-Seiten als eigene Datei speichern
Wählen Sie bestimmte Seiten aus einem großen PDF und speichern Sie sie als eigenes Dokument: online, ohne Software und ohne Qualitätsverlust.
Verwandte Tools
OCR-PDF online
OCR-PDF hält die PDF-Aufgabe in einem Browser-Ablauf: Quelldatei hochladen, Optionen prüfen, Verarbeitung starten und Ergebnis herunterladen.
PDF in Text online
Extrahieren Sie Text aus einer PDF in eine reine Textdatei, um den Inhalt ohne Formatierung und Layout zu kopieren.
Scan zu PDF
Verwandeln Sie Fotos und Scans von Dokumenten in eine aufgeräumte PDF, bereit zum Senden oder Drucken.
PDF komprimieren online
Reduzieren Sie die Größe einer PDF-Datei, damit sie sich leichter senden, hochladen oder speichern lässt. Besonders hilfreich bei Scans und Dokumenten mit Bildern.
Was als Nächstes sinnvoll ist
Alle Tools
PDF-Tool-Katalog zum Zusammenführen, Komprimieren, Teilen, Konvertieren, Drehen, Schützen und Entsperren von PDF-Dateien im Browser.
FAQ
Antworten auf häufige Fragen zu iHatePDF: Ist eine Registrierung nötig, wie werden Dateien verarbeitet, wo sieht man die Limits und ist das Hochladen von Dokumenten sicher.
Kontakt
Kontaktieren Sie iHatePDF bei Fragen zu Verarbeitungsfehlern, zur Tool-Auswahl, zu Sicherheit, geschäftlichen Anfragen und Vorschlägen für neue Funktionen.