Scanned PDF में OCR से text कैसे पहचानें
संक्षेप में: OCR पेज की शक्ल नहीं बदलता: तस्वीर के ऊपर एक अदृश्य टेक्स्ट लेयर आ जाती है और खोज तथा कॉपी काम करने लगती हैं। जिन पेजों में पहले से टेक्स्ट है, वे छोड़ दिए जाते हैं। गुणवत्ता मोड असल में रेंडर रिज़ॉल्यूशन है: तेज़ 100 DPI देता है, सटीक 300।
क्लस्टर
चरण-दर-चरण मार्गदर्शिका
इनपुट से भरोसेमंद परिणाम तक PDF कार्य ले जाने के लिए चरण-दर-चरण निर्देश.
मुख्य टूल
ओसीआर पीडीएफ ऑनलाइन
इस लेख वाला टूल खोलें और मौजूदा लोकैल में ऑपरेशन पूरा करें.
टूल खोलेंविषय-सूची
PDF में टेक्स्ट पहचान: स्कैन के साथ क्या होता है
स्कैन किया दस्तावेज़ दस्तावेज़ जैसा दिखता है और दस्तावेज़ जैसा पढ़ा जाता है, पर किसी भी प्रोग्राम के लिए वह एक तस्वीर है। उसमें खोजा नहीं जा सकता, उससे अनुबंध संख्या कॉपी नहीं की जा सकती, और टेक्स्ट की जाँच करने वाला फ़ॉर्म उसे ख़ाली फ़ाइल कहकर लौटा देता है।
पहचान ठीक यही काम करती है, और ऐसे तरीक़े से करती है जिसे समझ लेना अच्छा है: वह कुछ भी दोबारा नहीं लिखती।
फ़ाइल में असल में क्या जुड़ता है
पेज की तस्वीर अछूती रहती है। उसके ऊपर एक दूसरी परत आती है: टेक्स्ट, जो ठीक वहाँ रखा जाता है जहाँ तस्वीर में संबंधित अक्षर हैं, और अदृश्य बना दिया जाता है।
नतीजे के सारे गुण इसी से निकलते हैं। देखने में फ़ाइल मूल से अलग नहीं: वही काग़ज़, वही मुहरें, वही तिरछापन अगर था। साथ ही खोज शब्द ढूँढ़ लेती है, दो क्लिक से पंक्ति चुनी जाती है, और कॉपी करने पर असली टेक्स्ट मिलता है।
यही बात समझाती है कि जिन दस्तावेज़ों में शक्ल मायने रखती है, उनके लिए पहचान सुरक्षित क्यों है। हस्ताक्षर वाला स्कैन किया अनुबंध OCR के बाद वही स्कैन, वही हस्ताक्षर रहता है; बस अब उसमें खोजा जा सकता है।
जिन पेजों में पहले से टेक्स्ट है, वे छोड़ दिए जाते हैं
प्रोसेसिंग से पहले हर पेज में टेक्स्ट लेयर की जाँच होती है, और जिनमें वह है उनकी पहचान की ही नहीं जाती।
इससे दो व्यावहारिक नतीजे निकलते हैं।
मिश्रित दस्तावेज़ बिना किसी मेहनत के सही ढंग से निपटते हैं। अगर फ़ाइल का कुछ हिस्सा संपादक में टाइप हुआ और कुछ स्कैन के रूप में चिपकाया गया, तो सिर्फ़ दूसरा हिस्सा पहचाना जाता है। टाइप किया टेक्स्ट मूल ही रहता है, पहचानी हुई नक़ल से नहीं बदलता, और यह मायने रखता है: मूल टेक्स्ट सटीक होता है, पहचाना हुआ ग़लतियाँ रखता है।
सामान्य टेक्स्ट PDF पर OCR चलाना लगभग कुछ नहीं करता और कुछ बिगाड़ता भी नहीं। जब पता न हो कि सामने का दस्तावेज़ स्कैन है या नहीं, तब यह सुविधाजनक है: बस उसे टूल से गुज़ार दीजिए।
यही तर्क समय भी तय करता है। वह दस्तावेज़ के कुल पेजों पर नहीं, बिना टेक्स्ट वाले पेजों की संख्या पर निर्भर है। पाँच चिपकाए स्कैन वाली दो सौ पेज की रिपोर्ट पाँच पेज जितने समय में निपट जाती है।
तीन गुणवत्ता मोड यानी तीन रिज़ॉल्यूशन
गुणवत्ता का चुनाव एक ही चीज़ तय करता है: पहचान से पहले पेज किस रिज़ॉल्यूशन पर बनाया जाएगा।
| मोड | रिज़ॉल्यूशन | कब लें |
|---|---|---|
| तेज़ | 100 DPI | बड़े साफ़ अक्षर, मोटी जाँच |
| संतुलित | 150 DPI | सामान्य दस्तावेज़, अनुबंध, प्रमाणपत्र |
| सटीक | 300 DPI | छोटे अक्षर, पाद-टिप्पणियाँ, ख़राब प्रतियाँ |
डिफ़ॉल्ट तेज़ मोड है, और यह याद रखने लायक़ है। शीर्षकों और बारह पॉइंट के मुख्य टेक्स्ट के लिए सौ बिंदु प्रति इंच काफ़ी हैं, पर छोटी पाद-टिप्पणियाँ, तालिकाओं के अंक और मुहरें इस रेंडर पर साफ़ तौर पर ख़राब निकलती हैं।
नियम सीधा है: दस्तावेज़ में कुछ ऐसा हो जिसे आप ख़ुद आँखें सिकोड़कर पढ़ते हैं, तो सटीक मोड चुनिए। वह धीमा है, पर काम दोबारा नहीं करना पड़ेगा।
भाषा: «ऑटो» यानी एक साथ दो भाषाएँ
अंग्रेज़ी और रूसी उपलब्ध हैं, साथ ही एक ऑटो मोड।
ऑटो मोड भाषा का अनुमान नहीं लगाता। वह दस्तावेज़ को दोनों भाषाओं में एक साथ पहचानता है, जो ऐसे टेक्स्ट के लिए ठीक है जिसमें एक भाषा में दूसरी के नाम, कोड और शब्द बिखरे हों। इसकी क़ीमत है गति और एकरूप टेक्स्ट पर थोड़ी सटीकता।
दस्तावेज़ पूरा एक ही भाषा में हो तो उसी भाषा को चुनना थोड़ा बेहतर और तेज़ नतीजा देता है।
चुनी हुई भाषा उपलब्ध न हो तो पहचान गिरती नहीं: वह उपलब्ध भाषा से चलती है और नतीजे के साथ अलग चेतावनी जोड़ देती है, जिसमें माँगी गई और लगाई गई दोनों भाषाएँ लिखी होती हैं। वह चेतावनी बंद करने के बजाय पढ़ने लायक़ है: चुपचाप बदली भाषा किसी भी अटकल से बेहतर बताती है कि नतीजा अजीब क्यों आया।
दूसरी भाषाओं के दस्तावेज़ों के बारे में अलग से। लातिनी लिपि अंग्रेज़ी पैकेज से पहचानी जाती है, पर इस रास्ते में डायक्रिटिक चिह्न खो जाते हैं या बिगड़ जाते हैं: फ़्रांसीसी और जर्मन टेक्स्ट पढ़ने लायक़ तो निकलते हैं, पर उच्चारण-चिह्नों में ग़लतियों के साथ। लातिनी और सिरिलिक से अलग लिपियाँ बिल्कुल समर्थित नहीं हैं।
पहचान कैसे चलाएँ
1. ocr-pdf खोलिए और दस्तावेज़ अपलोड कीजिए। 2. भाषा चुनिए। मिश्रित टेक्स्ट के लिए ऑटो, एकरूप टेक्स्ट के लिए कोई एक भाषा। 3. दस्तावेज़ में छोटे अक्षर हों तो सटीक मोड लगाइए। 4. प्रोसेस चलाइए और नतीजा डाउनलोड कीजिए। 5. फ़ाइल खोलकर ऐसा शब्द खोजिए जो स्कैन पर निश्चित रूप से है। यही सबसे तेज़ जाँच है।
तिरछापन सुधार और उसकी क़ीमत
एक अलग स्विच पहचान से पहले झुके पेजों को सीधा करता है। वह डिफ़ॉल्ट रूप से बंद है, और इसकी वजह है।
सीधा करना पेज की एक अस्थायी प्रति पर लगता है, जिसे पहचान पढ़ती है, और टेक्स्ट लेयर उसके बाद मूल, बिना सुधारे पेज पर रखी जाती है। बहुत झुके स्कैन पर इससे खिसकाव आता है: अदृश्य टेक्स्ट दिखने वाले अक्षरों के मुक़ाबले घूमा हुआ बैठता है।
खोज पर इसका असर नहीं पड़ता, शब्द फिर भी मिल जाता है। माउस से चुनने पर पड़ता है: चयन का ढाँचा अक्षरों से हटकर गिरता है और कोई हिस्सा कॉपी करना असुविधाजनक हो जाता है।
यह समझौता जानबूझकर है, क्योंकि मूल पेज अछूते रहते हैं। झुकाव ज़्यादा हो तो बेहतर है कि दस्तावेज़ पहचान से पहले सीधा किया जाए, समकोण घुमाव के लिए rotate-pdf से या स्कैन को scan-to-pdf से दोबारा बनाकर, जहाँ असली सीधा करना मौजूद है।
पहचान क्या नहीं करती
वह मूल को बेहतर नहीं बनाती। हिली हुई तस्वीर, पंक्ति के आर-पार लैंप की चमक, आधे पेज पर हाथ की छाया, यह सब बना रहता है, और उस जगह पहचान कचरा देती है या उसे छोड़ देती है।
वह हस्तलिखित पाठ नहीं पढ़ती। टूल छपे हुए अक्षरों के लिए बना है।
वह क़ानूनी रूप से मान्य टेक्स्ट नहीं देती। पहचानी गई परत में ग़लतियाँ होती हैं और उसे दस्तावेज़ की प्रति के रूप में इस्तेमाल नहीं किया जा सकता। वह खोज के लिए और उन प्रणालियों के लिए है जिन्हें टेक्स्ट लेयर चाहिए, उद्धरण के लिए नहीं।
और वह रिज़ॉल्यूशन वापस नहीं लाती। मूल स्कैन 75 बिंदु प्रति इंच पर बना हो तो सटीक मोड उसे 300 पर बनाएगा, पर अक्षर बढ़ नहीं जाएँगे: धुँधली तस्वीर बस बड़ी हो जाएगी। पहचान की गुणवत्ता मूल तय करता है, सेटिंग नहीं।
कामों की शृंखला में पहचान कहाँ रखें
क्रम दिखने से ज़्यादा मायने रखता है, और नियम एक है: पहचान कंप्रेशन से पहले।
पहचान पेज की तस्वीर पर काम करती है। compress-pdf से कंप्रेशन उसी तस्वीर को बिगाड़ता है: रिज़ॉल्यूशन घटाता है और अक्षरों के इर्द-गिर्द विकृतियाँ जोड़ता है। उल्टा क्रम टेक्स्ट में साफ़ तौर पर ज़्यादा ग़लतियाँ देता है, और बाद में उन्हें सुधारने का कोई साधन नहीं बचता।
जोड़ना और घुमाना भी पहचान से पहले करना चाहिए: वे बदलते हैं कि कौन से पेज हैं और वे किस दिशा में हैं, और टेक्स्ट लेयर एक ख़ास पेज से बँधी होती है।
अगर आपको टेक्स्ट लेयर वाली फ़ाइल नहीं, बल्कि टेक्स्ट ही अलग फ़ाइल के रूप में चाहिए, तो उसके लिए pdf-to-text है: वह सामग्री को पेजवार बँटी सादा टेक्स्ट फ़ाइल में निकाल देता है।
FAQ
इस क्लस्टर से और
चरण-दर-चरण मार्गदर्शिका
PDF को एडिट करने योग्य Word में बदलें
फ़ाइल Word में खुल गई पर कर्सर पाठ में नहीं घुसता? पहले से चुनी सेटिंग छवि क्यों देती है, सतत ढंग «एकदम सही» से कैसे अलग है, और शीर्ष-पाद कहाँ चले गए।
चरण-दर-चरण मार्गदर्शिका
PDF से Excel में टेबल कैसे निकालें
PDF से Excel: डाउनलोड की गई कार्यपुस्तिका में कौन-सी शीटें आती हैं, पहचान के तीन ढंग व्यवहार में कैसे अलग हैं, और लचीला ढंग अधिक तालिकाएँ पाकर भी शब्द क्यों तोड़ देता है।
चरण-दर-चरण मार्गदर्शिका
PDF से चुनिंदा पेज अलग फाइल में लें
PDF से ज़रूरी पन्ने अलग फ़ाइल के रूप में निकालना: दोनों आउटपुट ढंग किस तरह अलग हैं, संग्रह की फ़ाइलें मूल पृष्ठ संख्याएँ क्यों सँभाले रखती हैं, और आकार सुरक्षित रखना बंद करने से क्या होता है।
संबंधित टूल
ओसीआर पीडीएफ ऑनलाइन
ओसीआर पीडीएफ PDF कार्य को एक ही ब्राउज़र प्रवाह में रखता है: स्रोत फ़ाइल अपलोड करें, विकल्प देखें, प्रक्रिया चलाएँ और परिणाम डाउनलोड करें.
PDF से टेक्स्ट ऑनलाइन
PDF से text को सादे text file में निकालें ताकि बिना formatting और layout के सामग्री copy हो सके.
PDF कंप्रेस करें ऑनलाइन
PDF file का size कम करें ताकि उसे email, upload या store करना आसान हो. यह scans और images वाले documents के लिए खास उपयोगी है.
PDF घुमाएँ ऑनलाइन
अगर scan या selected pages sideways या उलटे हैं, तो PDF page orientation ठीक करें.
आगे क्या करें
सभी टूल्स
PDF tools catalog: PDF merge, compress, split, convert, rotate, protect और unlock करें, सब कुछ सीधे आपके browser में.
अक्सर पूछे जाने वाले प्रश्न
iHatePDF के बारे में frequently asked questions के जवाब: क्या registration जरूरी है, files कैसे process होती हैं, limits कहाँ देखें और documents upload करना safe है या नहीं।
संपर्क
Processing errors, tool चुनने, safety, business queries और नए features के सुझावों के लिए iHatePDF से संपर्क करें।