Scanned PDF में OCR से text कैसे पहचानें

OCR की ज़रूरत कब होती है, recognition की quality किस पर निर्भर करती है और scanned PDF process करने के बाद क्या जाँचें.

संक्षेप में: स्कैन किए PDF में टेक्स्ट सिलेक्ट, सर्च और कॉपी करने लायक बनाने के लिए उसे ocr-pdf से गुज़ारें. यह छपे टेक्स्ट पर अच्छा काम करता है; पहचान की गुणवत्ता स्कैन पर निर्भर करती है, इसलिए साफ़, सीधा और अच्छे रिज़ॉल्यूशन वाला स्कैन बेहतर नतीजे देता है.

चरण-दर-चरण मार्गदर्शिका

इनपुट से भरोसेमंद परिणाम तक PDF कार्य ले जाने के लिए चरण-दर-चरण निर्देश.

आगे क्या करें

विषयसूची

आपको किसी scan किए contract, certificate या form वाला PDF मिलता है. आप text select करने की कोशिश करते हैं और कुछ नहीं होता: cursor ऐसे बर्ताव करता है जैसे page कोई image हो. और यह ठीक वही है, नीचे text layer बिना एक scan की हुई image. OCR (optical character recognition) यह layer जोड़ता है और image को ऐसे document में बदल देता है जहाँ text select, copy और search किया जा सकता है.

OCR की ज़रूरत कब होती है

OCR तब उपयोगी है जब आपके पास scan किया PDF हो और आप किसी हिस्से को बिना दोबारा टाइप किए copy करना चाहें, Ctrl+F से कोई शब्द ढूँढना चाहें, content को बिना दोबारा लिखे किसी और tool में ले जाना चाहें या किसी archived document को keyword से खोजने लायक बनाना चाहें. अगर PDF में पहले से text layer है — यानी आप शब्द select कर पाते हैं — तो OCR की ज़रूरत नहीं.

quality किस पर निर्भर करती है

नतीजे की quality लगभग पूरी तरह source scan पर निर्भर करती है. मुख्य बातें हैं resolution (कम से कम 150–200 dpi, बेहतर 300), page का alignment (बहुत तिरछा text ठीक से नहीं पहचाना जाता), रोशनी और contrast (spine की परछाइयाँ या पीला कागज़ accuracy घटाते हैं) और text की भाषा, जिसे algorithm को अक्षर ठीक से समझने के लिए जानना ज़रूरी है.

OCR कैसे चलाएँ, step by step

1. ocr-pdf tool खोलें और अपना scanned PDF upload करें. 2. पूछे जाने पर document की भाषा चुनें. 3. processing का इंतज़ार करें: कई pages के scan में ज़्यादा समय लगता है. 4. result download करें. 5. इसे खोलें और जाँचें: क्या text select होता है? क्या नाम, dates और numbers ठीक पहचाने गए?

क्या गलत हो सकता है

  • **नाम और numbers में बहुत errors.** scan की quality कम है. ऊँचे resolution पर दोबारा scan या photo लें.
  • **कोई text नहीं पहचाना जाता.** PDF में ऐसे vector graphics हो सकते हैं जो scan जैसे दिखें पर तकनीकी रूप से न हों; OCR वहाँ मदद नहीं करता.
  • **file बहुत बड़ी हो गई.** OCR एक text layer जोड़ता है और size थोड़ा बढ़ाता है; अगर बहुत भारी हो तो compress-pdf से compress करें.
  • **हाथ की लिखाई पढ़ने लायक नहीं.** standard OCR छपे text पर केंद्रित है; signatures और हाशिये के notes ठीक से या बिलकुल नहीं पहचाने जाते.

OCR के बाद क्या जाँचें

  • कुछ lines select करके किसी editor में paste करें और पक्का करें कि text सही आया.
  • Ctrl+F से keywords ढूँढें: एक नाम, एक संस्था, एक date.
  • पहचाने गए text के numbers और dates की original से तुलना करें; सबसे आम errors वहीं होती हैं.

निष्कर्ष

scanned PDF को खोजने और select करने लायक बनाने के लिए इसे ocr-pdf में upload करें. लंबे documents के लिए file को पहले split-pdf से बाँटें, हिस्से अलग process करें और नतीजे merge-pdf से जोड़ें.

अक्सर पूछे जाने वाले प्रश्न

क्या OCR हाथ की लिखाई पर काम करता है?

standard OCR छपे text पर अच्छा और हाथ की लिखाई पर कमज़ोर काम करता है. साफ़ लिखाई कुछ हद तक पहचानी जा सकती है, पर भरोसेमंद नहीं.

क्या OCR के बाद मैं PDF से text copy कर सकता हूँ?

हाँ. process के बाद PDF select करने लायक हो जाता है: आप text highlight कर सकते हैं, copy कर सकते हैं और document में search कर सकते हैं.

कुछ शब्द गलत क्यों पहचाने जाते हैं?

लगभग हमेशा scan की वजह से: धब्बे, तिरछा page, कम resolution या खराब रोशनी. बेहतर scan बेहतर नतीजे देता है.

क्या मुझे account चाहिए?

नहीं. बुनियादी workflow बिना account बनाए उपलब्ध है.

files कितने समय तक रखी जाती हैं?

files सिर्फ़ चुने गए operation के लिए इस्तेमाल होती हैं और processing पूरी होने के बाद अपने-आप delete हो जाती हैं. हम upload किए गए documents का इस्तेमाल AI models को train करने के लिए नहीं करते.

इस क्लस्टर के और लेख

यदि पढ़ने के बाद आपको PDF पर कोई व्यावहारिक अगला कदम या सेवा-सीमा के बारे में जवाब चाहिए, तो ये पेज खोलें।

संबंधित टूल

आगे क्या करें

यदि पढ़ने के बाद आपको PDF पर कोई व्यावहारिक अगला कदम या सेवा-सीमा के बारे में जवाब चाहिए, तो ये पेज खोलें।