आपको किसी scan किए contract, certificate या form वाला PDF मिलता है. आप text select करने की कोशिश करते हैं और कुछ नहीं होता: cursor ऐसे बर्ताव करता है जैसे page कोई image हो. और यह ठीक वही है, नीचे text layer बिना एक scan की हुई image. OCR (optical character recognition) यह layer जोड़ता है और image को ऐसे document में बदल देता है जहाँ text select, copy और search किया जा सकता है.
OCR की ज़रूरत कब होती है
OCR तब उपयोगी है जब आपके पास scan किया PDF हो और आप किसी हिस्से को बिना दोबारा टाइप किए copy करना चाहें, Ctrl+F से कोई शब्द ढूँढना चाहें, content को बिना दोबारा लिखे किसी और tool में ले जाना चाहें या किसी archived document को keyword से खोजने लायक बनाना चाहें. अगर PDF में पहले से text layer है — यानी आप शब्द select कर पाते हैं — तो OCR की ज़रूरत नहीं.
quality किस पर निर्भर करती है
नतीजे की quality लगभग पूरी तरह source scan पर निर्भर करती है. मुख्य बातें हैं resolution (कम से कम 150–200 dpi, बेहतर 300), page का alignment (बहुत तिरछा text ठीक से नहीं पहचाना जाता), रोशनी और contrast (spine की परछाइयाँ या पीला कागज़ accuracy घटाते हैं) और text की भाषा, जिसे algorithm को अक्षर ठीक से समझने के लिए जानना ज़रूरी है.
OCR कैसे चलाएँ, step by step
1. ocr-pdf tool खोलें और अपना scanned PDF upload करें. 2. पूछे जाने पर document की भाषा चुनें. 3. processing का इंतज़ार करें: कई pages के scan में ज़्यादा समय लगता है. 4. result download करें. 5. इसे खोलें और जाँचें: क्या text select होता है? क्या नाम, dates और numbers ठीक पहचाने गए?
क्या गलत हो सकता है
- **नाम और numbers में बहुत errors.** scan की quality कम है. ऊँचे resolution पर दोबारा scan या photo लें.
- **कोई text नहीं पहचाना जाता.** PDF में ऐसे vector graphics हो सकते हैं जो scan जैसे दिखें पर तकनीकी रूप से न हों; OCR वहाँ मदद नहीं करता.
- **file बहुत बड़ी हो गई.** OCR एक text layer जोड़ता है और size थोड़ा बढ़ाता है; अगर बहुत भारी हो तो compress-pdf से compress करें.
- **हाथ की लिखाई पढ़ने लायक नहीं.** standard OCR छपे text पर केंद्रित है; signatures और हाशिये के notes ठीक से या बिलकुल नहीं पहचाने जाते.
OCR के बाद क्या जाँचें
- कुछ lines select करके किसी editor में paste करें और पक्का करें कि text सही आया.
- Ctrl+F से keywords ढूँढें: एक नाम, एक संस्था, एक date.
- पहचाने गए text के numbers और dates की original से तुलना करें; सबसे आम errors वहीं होती हैं.
निष्कर्ष
scanned PDF को खोजने और select करने लायक बनाने के लिए इसे ocr-pdf में upload करें. लंबे documents के लिए file को पहले split-pdf से बाँटें, हिस्से अलग process करें और नतीजे merge-pdf से जोड़ें.