मुख्य सामग्री पर जाएं
लेख

Scanned PDF में OCR से text कैसे पहचानें

पहचान पेज की अछूती तस्वीर के ऊपर एक अदृश्य टेक्स्ट लेयर रख देती है। डिफ़ॉल्ट मोड सबसे तेज़ क्यों है, «ऑटो» भाषा का क्या करता है, और तिरछापन सुधार डिफ़ॉल्ट रूप से चालू क्यों नहीं है।

संक्षेप में: OCR पेज की शक्ल नहीं बदलता: तस्वीर के ऊपर एक अदृश्य टेक्स्ट लेयर आ जाती है और खोज तथा कॉपी काम करने लगती हैं। जिन पेजों में पहले से टेक्स्ट है, वे छोड़ दिए जाते हैं। गुणवत्ता मोड असल में रेंडर रिज़ॉल्यूशन है: तेज़ 100 DPI देता है, सटीक 300।

क्लस्टर

चरण-दर-चरण मार्गदर्शिका

इनपुट से भरोसेमंद परिणाम तक PDF कार्य ले जाने के लिए चरण-दर-चरण निर्देश.

13 लेख

मुख्य टूल

ओसीआर पीडीएफ ऑनलाइन

इस लेख वाला टूल खोलें और मौजूदा लोकैल में ऑपरेशन पूरा करें.

टूल खोलें

विषय-सूची

PDF में टेक्स्ट पहचान: स्कैन के साथ क्या होता है

स्कैन किया दस्तावेज़ दस्तावेज़ जैसा दिखता है और दस्तावेज़ जैसा पढ़ा जाता है, पर किसी भी प्रोग्राम के लिए वह एक तस्वीर है। उसमें खोजा नहीं जा सकता, उससे अनुबंध संख्या कॉपी नहीं की जा सकती, और टेक्स्ट की जाँच करने वाला फ़ॉर्म उसे ख़ाली फ़ाइल कहकर लौटा देता है।

पहचान ठीक यही काम करती है, और ऐसे तरीक़े से करती है जिसे समझ लेना अच्छा है: वह कुछ भी दोबारा नहीं लिखती।

फ़ाइल में असल में क्या जुड़ता है

पेज की तस्वीर अछूती रहती है। उसके ऊपर एक दूसरी परत आती है: टेक्स्ट, जो ठीक वहाँ रखा जाता है जहाँ तस्वीर में संबंधित अक्षर हैं, और अदृश्य बना दिया जाता है।

नतीजे के सारे गुण इसी से निकलते हैं। देखने में फ़ाइल मूल से अलग नहीं: वही काग़ज़, वही मुहरें, वही तिरछापन अगर था। साथ ही खोज शब्द ढूँढ़ लेती है, दो क्लिक से पंक्ति चुनी जाती है, और कॉपी करने पर असली टेक्स्ट मिलता है।

यही बात समझाती है कि जिन दस्तावेज़ों में शक्ल मायने रखती है, उनके लिए पहचान सुरक्षित क्यों है। हस्ताक्षर वाला स्कैन किया अनुबंध OCR के बाद वही स्कैन, वही हस्ताक्षर रहता है; बस अब उसमें खोजा जा सकता है।

जिन पेजों में पहले से टेक्स्ट है, वे छोड़ दिए जाते हैं

प्रोसेसिंग से पहले हर पेज में टेक्स्ट लेयर की जाँच होती है, और जिनमें वह है उनकी पहचान की ही नहीं जाती।

इससे दो व्यावहारिक नतीजे निकलते हैं।

मिश्रित दस्तावेज़ बिना किसी मेहनत के सही ढंग से निपटते हैं। अगर फ़ाइल का कुछ हिस्सा संपादक में टाइप हुआ और कुछ स्कैन के रूप में चिपकाया गया, तो सिर्फ़ दूसरा हिस्सा पहचाना जाता है। टाइप किया टेक्स्ट मूल ही रहता है, पहचानी हुई नक़ल से नहीं बदलता, और यह मायने रखता है: मूल टेक्स्ट सटीक होता है, पहचाना हुआ ग़लतियाँ रखता है।

सामान्य टेक्स्ट PDF पर OCR चलाना लगभग कुछ नहीं करता और कुछ बिगाड़ता भी नहीं। जब पता न हो कि सामने का दस्तावेज़ स्कैन है या नहीं, तब यह सुविधाजनक है: बस उसे टूल से गुज़ार दीजिए।

यही तर्क समय भी तय करता है। वह दस्तावेज़ के कुल पेजों पर नहीं, बिना टेक्स्ट वाले पेजों की संख्या पर निर्भर है। पाँच चिपकाए स्कैन वाली दो सौ पेज की रिपोर्ट पाँच पेज जितने समय में निपट जाती है।

तीन गुणवत्ता मोड यानी तीन रिज़ॉल्यूशन

गुणवत्ता का चुनाव एक ही चीज़ तय करता है: पहचान से पहले पेज किस रिज़ॉल्यूशन पर बनाया जाएगा।

मोडरिज़ॉल्यूशनकब लें
तेज़100 DPIबड़े साफ़ अक्षर, मोटी जाँच
संतुलित150 DPIसामान्य दस्तावेज़, अनुबंध, प्रमाणपत्र
सटीक300 DPIछोटे अक्षर, पाद-टिप्पणियाँ, ख़राब प्रतियाँ

डिफ़ॉल्ट तेज़ मोड है, और यह याद रखने लायक़ है। शीर्षकों और बारह पॉइंट के मुख्य टेक्स्ट के लिए सौ बिंदु प्रति इंच काफ़ी हैं, पर छोटी पाद-टिप्पणियाँ, तालिकाओं के अंक और मुहरें इस रेंडर पर साफ़ तौर पर ख़राब निकलती हैं।

नियम सीधा है: दस्तावेज़ में कुछ ऐसा हो जिसे आप ख़ुद आँखें सिकोड़कर पढ़ते हैं, तो सटीक मोड चुनिए। वह धीमा है, पर काम दोबारा नहीं करना पड़ेगा।

भाषा: «ऑटो» यानी एक साथ दो भाषाएँ

अंग्रेज़ी और रूसी उपलब्ध हैं, साथ ही एक ऑटो मोड।

ऑटो मोड भाषा का अनुमान नहीं लगाता। वह दस्तावेज़ को दोनों भाषाओं में एक साथ पहचानता है, जो ऐसे टेक्स्ट के लिए ठीक है जिसमें एक भाषा में दूसरी के नाम, कोड और शब्द बिखरे हों। इसकी क़ीमत है गति और एकरूप टेक्स्ट पर थोड़ी सटीकता।

दस्तावेज़ पूरा एक ही भाषा में हो तो उसी भाषा को चुनना थोड़ा बेहतर और तेज़ नतीजा देता है।

चुनी हुई भाषा उपलब्ध न हो तो पहचान गिरती नहीं: वह उपलब्ध भाषा से चलती है और नतीजे के साथ अलग चेतावनी जोड़ देती है, जिसमें माँगी गई और लगाई गई दोनों भाषाएँ लिखी होती हैं। वह चेतावनी बंद करने के बजाय पढ़ने लायक़ है: चुपचाप बदली भाषा किसी भी अटकल से बेहतर बताती है कि नतीजा अजीब क्यों आया।

दूसरी भाषाओं के दस्तावेज़ों के बारे में अलग से। लातिनी लिपि अंग्रेज़ी पैकेज से पहचानी जाती है, पर इस रास्ते में डायक्रिटिक चिह्न खो जाते हैं या बिगड़ जाते हैं: फ़्रांसीसी और जर्मन टेक्स्ट पढ़ने लायक़ तो निकलते हैं, पर उच्चारण-चिह्नों में ग़लतियों के साथ। लातिनी और सिरिलिक से अलग लिपियाँ बिल्कुल समर्थित नहीं हैं।

पहचान कैसे चलाएँ

1. ocr-pdf खोलिए और दस्तावेज़ अपलोड कीजिए। 2. भाषा चुनिए। मिश्रित टेक्स्ट के लिए ऑटो, एकरूप टेक्स्ट के लिए कोई एक भाषा। 3. दस्तावेज़ में छोटे अक्षर हों तो सटीक मोड लगाइए। 4. प्रोसेस चलाइए और नतीजा डाउनलोड कीजिए। 5. फ़ाइल खोलकर ऐसा शब्द खोजिए जो स्कैन पर निश्चित रूप से है। यही सबसे तेज़ जाँच है।

तिरछापन सुधार और उसकी क़ीमत

एक अलग स्विच पहचान से पहले झुके पेजों को सीधा करता है। वह डिफ़ॉल्ट रूप से बंद है, और इसकी वजह है।

सीधा करना पेज की एक अस्थायी प्रति पर लगता है, जिसे पहचान पढ़ती है, और टेक्स्ट लेयर उसके बाद मूल, बिना सुधारे पेज पर रखी जाती है। बहुत झुके स्कैन पर इससे खिसकाव आता है: अदृश्य टेक्स्ट दिखने वाले अक्षरों के मुक़ाबले घूमा हुआ बैठता है।

खोज पर इसका असर नहीं पड़ता, शब्द फिर भी मिल जाता है। माउस से चुनने पर पड़ता है: चयन का ढाँचा अक्षरों से हटकर गिरता है और कोई हिस्सा कॉपी करना असुविधाजनक हो जाता है।

यह समझौता जानबूझकर है, क्योंकि मूल पेज अछूते रहते हैं। झुकाव ज़्यादा हो तो बेहतर है कि दस्तावेज़ पहचान से पहले सीधा किया जाए, समकोण घुमाव के लिए rotate-pdf से या स्कैन को scan-to-pdf से दोबारा बनाकर, जहाँ असली सीधा करना मौजूद है।

पहचान क्या नहीं करती

वह मूल को बेहतर नहीं बनाती। हिली हुई तस्वीर, पंक्ति के आर-पार लैंप की चमक, आधे पेज पर हाथ की छाया, यह सब बना रहता है, और उस जगह पहचान कचरा देती है या उसे छोड़ देती है।

वह हस्तलिखित पाठ नहीं पढ़ती। टूल छपे हुए अक्षरों के लिए बना है।

वह क़ानूनी रूप से मान्य टेक्स्ट नहीं देती। पहचानी गई परत में ग़लतियाँ होती हैं और उसे दस्तावेज़ की प्रति के रूप में इस्तेमाल नहीं किया जा सकता। वह खोज के लिए और उन प्रणालियों के लिए है जिन्हें टेक्स्ट लेयर चाहिए, उद्धरण के लिए नहीं।

और वह रिज़ॉल्यूशन वापस नहीं लाती। मूल स्कैन 75 बिंदु प्रति इंच पर बना हो तो सटीक मोड उसे 300 पर बनाएगा, पर अक्षर बढ़ नहीं जाएँगे: धुँधली तस्वीर बस बड़ी हो जाएगी। पहचान की गुणवत्ता मूल तय करता है, सेटिंग नहीं।

कामों की शृंखला में पहचान कहाँ रखें

क्रम दिखने से ज़्यादा मायने रखता है, और नियम एक है: पहचान कंप्रेशन से पहले।

पहचान पेज की तस्वीर पर काम करती है। compress-pdf से कंप्रेशन उसी तस्वीर को बिगाड़ता है: रिज़ॉल्यूशन घटाता है और अक्षरों के इर्द-गिर्द विकृतियाँ जोड़ता है। उल्टा क्रम टेक्स्ट में साफ़ तौर पर ज़्यादा ग़लतियाँ देता है, और बाद में उन्हें सुधारने का कोई साधन नहीं बचता।

जोड़ना और घुमाना भी पहचान से पहले करना चाहिए: वे बदलते हैं कि कौन से पेज हैं और वे किस दिशा में हैं, और टेक्स्ट लेयर एक ख़ास पेज से बँधी होती है।

अगर आपको टेक्स्ट लेयर वाली फ़ाइल नहीं, बल्कि टेक्स्ट ही अलग फ़ाइल के रूप में चाहिए, तो उसके लिए pdf-to-text है: वह सामग्री को पेजवार बँटी सादा टेक्स्ट फ़ाइल में निकाल देता है।

FAQ

नहीं। पेज की तस्वीर वैसी ही रहती है और उसके ऊपर एक अदृश्य टेक्स्ट लेयर जुड़ जाती है। देखने में फ़ाइल मूल से अलग नहीं लगती, जबकि खोज और कॉपी काम करने लगती हैं।
लगभग कुछ नहीं: जिन पेजों में पहले से टेक्स्ट है वे बिना प्रोसेस हुए छोड़ दिए जाते हैं। मिश्रित दस्तावेज़ों के लिए यह सुविधाजनक है, जहाँ कुछ पेज टाइप किए और कुछ स्कैन किए गए हों।
अंग्रेज़ी और रूसी। ऑटो मोड दोनों को एक साथ पहचानता है, जो मिश्रित टेक्स्ट वाले दस्तावेज़ों के लिए ठीक है। चुनी भाषा उपलब्ध न हो तो पहचान उपलब्ध भाषा से चलती है और अलग चेतावनी में यह बताती है।
नहीं, बुनियादी काम बिना पंजीकरण के होता है।
फ़ाइलें केवल चुने गए ऑपरेशन के लिए उपयोग होती हैं और प्रोसेसिंग पूरी होते ही स्वतः हटा दी जाती हैं। हम अपलोड किए गए दस्तावेज़ों का उपयोग AI मॉडल के प्रशिक्षण के लिए नहीं करते।

इस क्लस्टर से और

चरण-दर-चरण मार्गदर्शिका

PDF को एडिट करने योग्य Word में बदलें

फ़ाइल Word में खुल गई पर कर्सर पाठ में नहीं घुसता? पहले से चुनी सेटिंग छवि क्यों देती है, सतत ढंग «एकदम सही» से कैसे अलग है, और शीर्ष-पाद कहाँ चले गए।

चरण-दर-चरण मार्गदर्शिका

PDF से Excel में टेबल कैसे निकालें

PDF से Excel: डाउनलोड की गई कार्यपुस्तिका में कौन-सी शीटें आती हैं, पहचान के तीन ढंग व्यवहार में कैसे अलग हैं, और लचीला ढंग अधिक तालिकाएँ पाकर भी शब्द क्यों तोड़ देता है।

चरण-दर-चरण मार्गदर्शिका

PDF से चुनिंदा पेज अलग फाइल में लें

PDF से ज़रूरी पन्ने अलग फ़ाइल के रूप में निकालना: दोनों आउटपुट ढंग किस तरह अलग हैं, संग्रह की फ़ाइलें मूल पृष्ठ संख्याएँ क्यों सँभाले रखती हैं, और आकार सुरक्षित रखना बंद करने से क्या होता है।

संबंधित टूल

← अनुकूलन श्रेणी के सभी टूल

आगे क्या करें

अगर पढ़ने के बाद आपको अगला व्यावहारिक कदम या सेवा के बारे में और मार्गदर्शन चाहिए, तो ये पेज खोलें.

सभी टूल्स

PDF tools catalog: PDF merge, compress, split, convert, rotate, protect और unlock करें, सब कुछ सीधे आपके browser में.

अक्सर पूछे जाने वाले प्रश्न

iHatePDF के बारे में frequently asked questions के जवाब: क्या registration जरूरी है, files कैसे process होती हैं, limits कहाँ देखें और documents upload करना safe है या नहीं।

संपर्क

Processing errors, tool चुनने, safety, business queries और नए features के सुझावों के लिए iHatePDF से संपर्क करें।