Text in einem gescannten PDF per OCR erkennen

Wann Sie OCR brauchen, wovon die Erkennungsqualität abhängt und was Sie nach der Verarbeitung eines gescannten PDFs prüfen.

Kurz gesagt: Um Text in einem gescannten PDF erkennbar zu machen, lassen Sie es durch OCR laufen: Danach wird das Dokument markierbar und durchsuchbar. Die Qualität hängt vom Scan ab; bei Handschrift ist OCR unzuverlässig.

Schritt-für-Schritt-Anleitung

Schritt-für-Schritt-Anleitungen, um eine PDF-Aufgabe von der Eingabe zum Ergebnis zu bringen.

Nächste Schritte

Inhaltsverzeichnis

Sie erhalten ein PDF mit einem gescannten Vertrag, Zertifikat oder Formular. Sie versuchen, Text zu markieren, und nichts passiert: Der Cursor verhält sich, als wäre die Seite ein Bild. Genau das ist sie auch, ein gescanntes Bild ohne darunterliegende Textebene. OCR (optische Zeichenerkennung) fügt diese Ebene hinzu und macht aus dem Bild ein Dokument, in dem Text markiert, kopiert und durchsucht werden kann.

Wann Sie OCR brauchen

OCR ist nützlich, wenn Sie ein gescanntes PDF haben und eine Passage kopieren möchten, ohne sie abzutippen, ein Wort mit Strg+F suchen, den Inhalt ohne Neueingabe in ein anderes Werkzeug übernehmen oder ein archiviertes Dokument per Stichwort auffindbar machen wollen. Hat das PDF bereits eine Textebene – Sie können also Wörter markieren – wird kein OCR benötigt.

Wovon die Qualität abhängt

Die Qualität des Ergebnisses hängt fast vollständig vom Ausgangsscan ab. Wichtig sind die Auflösung (mindestens 150–200 dpi, ideal 300), die Ausrichtung der Seite (stark geneigter Text wird schlecht erkannt), Beleuchtung und Kontrast (Schatten vom Buchrücken oder vergilbtes Papier senken die Genauigkeit) sowie die Sprache des Textes, die der Algorithmus zur richtigen Deutung der Buchstaben kennen muss.

OCR ausführen, Schritt für Schritt

1. Öffnen Sie das Werkzeug ocr-pdf und laden Sie Ihr gescanntes PDF hoch. 2. Wählen Sie die Sprache des Dokuments, falls Sie danach gefragt werden. 3. Warten Sie auf die Verarbeitung: Mehrseitige Scans dauern länger. 4. Laden Sie das Ergebnis herunter. 5. Öffnen Sie es und prüfen Sie: Lässt sich Text markieren? Werden Namen, Daten und Zahlen korrekt erkannt?

Was schiefgehen kann

  • **Viele Fehler bei Namen und Zahlen.** Die Scanqualität ist zu niedrig. Scannen oder fotografieren Sie mit höherer Auflösung neu.
  • **Es wird gar kein Text erkannt.** Das PDF kann Vektorgrafiken enthalten, die wie ein Scan aussehen, es aber nicht sind; OCR hilft dort nicht.
  • **Die Datei ist viel größer geworden.** OCR fügt eine Textebene hinzu und erhöht das Gewicht leicht; ist sie zu schwer, komprimieren Sie sie mit compress-pdf.
  • **Handschrift ist nicht lesbar.** Standard-OCR zielt auf gedruckten Text; Unterschriften und Randnotizen werden schlecht oder gar nicht erkannt.

Was Sie nach dem OCR prüfen sollten

  • Markieren Sie einige Zeilen und fügen Sie sie in einen Editor ein, um den Text zu bestätigen.
  • Suchen Sie Stichwörter mit Strg+F: einen Namen, eine Organisation, ein Datum.
  • Vergleichen Sie Zahlen und Daten im erkannten Text mit dem Original; dort liegen die häufigsten Fehler.

Fazit

Um ein gescanntes PDF durchsuchbar und markierbar zu machen, laden Sie es in ocr-pdf. Bei langen Dokumenten teilen Sie die Datei zuerst mit split-pdf, verarbeiten die Teile getrennt und führen die Ergebnisse mit merge-pdf zusammen.

Häufige Fragen

Funktioniert OCR bei Handschrift?

Standard-OCR funktioniert gut bei gedrucktem Text und schlecht bei Handschrift. Saubere Handschrift wird teils erkannt, ist aber nicht verlässlich.

Kann ich nach dem OCR Text aus dem PDF kopieren?

Ja. Nach der Verarbeitung wird das PDF markierbar: Sie können Text hervorheben, kopieren und im Dokument suchen.

Warum werden manche Wörter falsch erkannt?

Fast immer wegen des Scans: Flecken, schiefe Seite, niedrige Auflösung oder schlechtes Licht. Ein besserer Scan liefert bessere Ergebnisse.

Brauche ich ein Konto?

Nein. Der grundlegende Ablauf ist ohne Konto verfügbar.

Wie lange werden Dateien gespeichert?

Dateien werden nur für die gewählte Operation verwendet und nach Abschluss der Verarbeitung automatisch gelöscht. Wir nutzen hochgeladene Dokumente nicht zum Training von KI-Modellen.

Weitere Artikel aus diesem Cluster

Wenn Sie nach dem Lesen einen praktischen PDF-Schritt oder eine Antwort zu den Servicegrenzen brauchen, öffnen Sie diese Seiten.

Verwandte Tools

Nächste Schritte

Wenn Sie nach dem Lesen einen praktischen PDF-Schritt oder eine Antwort zu den Servicegrenzen brauchen, öffnen Sie diese Seiten.