Sie erhalten ein PDF mit einem gescannten Vertrag, Zertifikat oder Formular. Sie versuchen, Text zu markieren, und nichts passiert: Der Cursor verhält sich, als wäre die Seite ein Bild. Genau das ist sie auch, ein gescanntes Bild ohne darunterliegende Textebene. OCR (optische Zeichenerkennung) fügt diese Ebene hinzu und macht aus dem Bild ein Dokument, in dem Text markiert, kopiert und durchsucht werden kann.
Wann Sie OCR brauchen
OCR ist nützlich, wenn Sie ein gescanntes PDF haben und eine Passage kopieren möchten, ohne sie abzutippen, ein Wort mit Strg+F suchen, den Inhalt ohne Neueingabe in ein anderes Werkzeug übernehmen oder ein archiviertes Dokument per Stichwort auffindbar machen wollen. Hat das PDF bereits eine Textebene – Sie können also Wörter markieren – wird kein OCR benötigt.
Wovon die Qualität abhängt
Die Qualität des Ergebnisses hängt fast vollständig vom Ausgangsscan ab. Wichtig sind die Auflösung (mindestens 150–200 dpi, ideal 300), die Ausrichtung der Seite (stark geneigter Text wird schlecht erkannt), Beleuchtung und Kontrast (Schatten vom Buchrücken oder vergilbtes Papier senken die Genauigkeit) sowie die Sprache des Textes, die der Algorithmus zur richtigen Deutung der Buchstaben kennen muss.
OCR ausführen, Schritt für Schritt
1. Öffnen Sie das Werkzeug ocr-pdf und laden Sie Ihr gescanntes PDF hoch. 2. Wählen Sie die Sprache des Dokuments, falls Sie danach gefragt werden. 3. Warten Sie auf die Verarbeitung: Mehrseitige Scans dauern länger. 4. Laden Sie das Ergebnis herunter. 5. Öffnen Sie es und prüfen Sie: Lässt sich Text markieren? Werden Namen, Daten und Zahlen korrekt erkannt?
Was schiefgehen kann
- **Viele Fehler bei Namen und Zahlen.** Die Scanqualität ist zu niedrig. Scannen oder fotografieren Sie mit höherer Auflösung neu.
- **Es wird gar kein Text erkannt.** Das PDF kann Vektorgrafiken enthalten, die wie ein Scan aussehen, es aber nicht sind; OCR hilft dort nicht.
- **Die Datei ist viel größer geworden.** OCR fügt eine Textebene hinzu und erhöht das Gewicht leicht; ist sie zu schwer, komprimieren Sie sie mit compress-pdf.
- **Handschrift ist nicht lesbar.** Standard-OCR zielt auf gedruckten Text; Unterschriften und Randnotizen werden schlecht oder gar nicht erkannt.
Was Sie nach dem OCR prüfen sollten
- Markieren Sie einige Zeilen und fügen Sie sie in einen Editor ein, um den Text zu bestätigen.
- Suchen Sie Stichwörter mit Strg+F: einen Namen, eine Organisation, ein Datum.
- Vergleichen Sie Zahlen und Daten im erkannten Text mit dem Original; dort liegen die häufigsten Fehler.
Fazit
Um ein gescanntes PDF durchsuchbar und markierbar zu machen, laden Sie es in ocr-pdf. Bei langen Dokumenten teilen Sie die Datei zuerst mit split-pdf, verarbeiten die Teile getrennt und führen die Ergebnisse mit merge-pdf zusammen.