PDF में टेक्स्ट पहचानें (OCR)

मूल पृष्ठ रूप बनाए रखते हुए स्कैन खोजने योग्य बनाएँ।

PDF फ़ाइलें चुनें

फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।

अधिकतम 100 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं

विषय सूचीअनुभाग: 12

PDF को OCR कब चाहिए?

अपने ब्राउज़र में चलने वाले Tesseract से स्कैन किए गए PDF में खोजने योग्य टेक्स्ट परत जोड़ें। स्रोत से मेल खाने वाली भाषा चुनें; डिफ़ॉल्ट रूप से अंग्रेज़ी चुनी होती है। समर्थित रीडर पहचाने गए शब्द खोज और चुन सकते हैं, जबकि स्कैन किए गए पृष्ठ का मूल रूप बना रहता है।

डिफ़ॉल्ट रूप से प्रक्रिया उन पृष्ठों को बनाए रखती है जिनमें पहले से टेक्स्ट है। हर चुने हुए पृष्ठ की पहचान भी कर सकते हैं; इससे नई परत जुड़ती है और मौजूदा टेक्स्ट दोहर सकता है। OCR की शुद्धता फ़ोकस, कंट्रास्ट, भाषा और पृष्ठ संरेखण पर निर्भर करती है। छोटे अक्षरों, हस्तलेखन, असामान्य फ़ॉन्ट और धब्बों वाले स्कैन पर अपने आप भरोसा करने के बजाय सावधानीपूर्वक समीक्षा आवश्यक है।

PDF में OCR की सुविधाएँ

खोजने योग्य PDF या TXT

पहचाने गए शब्द सामान्य टेक्स्ट के रूप में डाउनलोड करें या PDF में स्कैन का रूप बनाए रखते हुए उस पर टेक्स्ट परत जोड़ें।

अधिकतम 20 चुने हुए पृष्ठ

डाउनलोड में केवल चुने गए पृष्ठ होते हैं। अधिकतम 20 पृष्ठ चुनें; पूरा दस्तावेज़ शामिल करने के लिए पृष्ठ फ़ील्ड केवल तभी खाली छोड़ें जब उसमें 20 या कम पृष्ठ हों।

पहचान के नियंत्रण

स्रोत भाषा, 200 या 300 DPI, पहचान के लिए घुमाव और स्वचालित, एकल खंड या बिखरे टेक्स्ट वाला पृष्ठ लेआउट चुनें। समर्थित भाषाएँ नीचे के अक्सर पूछे जाने वाले प्रश्नों में दी गई हैं।

डिफ़ॉल्ट रूप से मौजूदा टेक्स्ट रखें

पहले से टेक्स्ट वाले पृष्ठ बनाए रखे जा सकते हैं। टेक्स्ट परत दोहरने की संभावना पर विचार करने के बाद ही ज़बरन पहचान चलाएँ।

स्कैन में खोजने योग्य टेक्स्ट परत क्यों जोड़ें?

स्कैन पृष्ठ को तस्वीर के रूप में सहेजता है, इसलिए सामान्य टेक्स्ट खोज उस पर छपे शब्द नहीं ढूँढ़ सकती। चुनी गई भाषा में OCR टाइप किए गए स्कैन को खोजने योग्य बना सकता है और कॉपी-पेस्ट या बाद में टेक्स्ट निकालने के लिए शब्द दे सकता है। यह उन अभिलेखों के लिए विशेष रूप से उपयोगी है जहाँ पृष्ठ का डिज़ाइन बदलने से अधिक ज्ञात नाम या वाक्यांश खोजना महत्वपूर्ण हो। स्कैन साफ़ दिखने पर भी पहचानी गई परत में गलतियाँ हो सकती हैं। खोज और चयन जाँचें, फिर निकाले गए शब्द इस्तेमाल करने से पहले नाम, संदर्भ और संख्याएँ पृष्ठ चित्र से मिलाएँ।

PDF स्कैन पर OCR कौन इस्तेमाल करता है?

पुस्तकालय और अभिलेख कर्मचारी

छोटे टाइप किए गए रिकॉर्ड को शीर्षक, नाम या संदर्भ संख्या से खोजने योग्य बनाएँ। मूल स्कैन सँभालें और डाउनलोड की गई प्रति में उन शब्दों की खोज जाँचें, जिसमें आसानी से गड़बड़ होने वाले वर्ण भी शामिल हों।

स्कैन की गई अध्ययन सामग्री वाले विद्यार्थी

अध्ययन नोट्स बनाने से पहले टाइप किए गए पाठ्यक्रम नोट्स खोजने योग्य बनाएँ। हाथ से लिखी टिप्पणियाँ अविश्वसनीय रह सकती हैं, इसलिए उद्धृत अंश स्कैन से मिलाएँ।

नियमित कार्मिक प्रशासन के कर्मचारी

आंतरिक सूचकांक के लिए स्वीकृत स्कैन किए गए ज्ञापन से शब्द निकालें। तारीखें, कर्मचारियों के नाम और संदर्भ संख्याएँ सावधानी से मिलाएँ, क्योंकि एक पहचाना गया वर्ण भी पहचानकर्ता बदल सकता है।

स्कैन किए गए PDF को खोजने योग्य कैसे बनाएँ?

  1. अनएन्क्रिप्टेड स्कैन चुनें और 20 से अधिक पृष्ठ न चुनें। PDF डाउनलोड में केवल वही चयन होता है। इस प्रकार के स्कैन पर पहले काम न किया हो तो छोटे नमूने से शुरू करें।
  2. टेक्स्ट की भाषा में स्रोत भाषा चुनें। खोजने योग्य PDF या सामान्य टेक्स्ट चुनें, पहचान का रिज़ॉल्यूशन तय करें और स्कैन को ज़रूरत हो तो घुमाव या पृष्ठ लेआउट चुनें।
  3. डिफ़ॉल्ट रूप से मौजूदा टेक्स्ट रखें, या सोच-समझकर हर चुने हुए पृष्ठ की पहचान करें चुनें। OCR शुरू करें और पहचान पूरी होने की प्रतीक्षा करें।
  4. परिणाम डाउनलोड करें। ज्ञात वाक्यांश खोजें, एक पंक्ति कॉपी करें और वर्तनी तथा संख्याएँ मूल स्कैन से मिलाएँ।

स्रोत फ़ाइल चुनें

समर्थित भाषा वाला स्कैन चुनें और अधिकतम 20 पृष्ठ चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF में टेक्स्ट पहचानें (OCR), चरण 1: समर्थित भाषा वाला स्कैन चुनें और अधिकतम 20 पृष्ठ चुनें।

टूल की सेटिंग जाँचें

स्रोत भाषा, OCR परिणाम, रिज़ॉल्यूशन, लेआउट और पहचान की दिशा चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF में टेक्स्ट पहचानें (OCR), चरण 2: स्रोत भाषा, OCR परिणाम, रिज़ॉल्यूशन, लेआउट और पहचान की दिशा चुनें।

परिणाम डाउनलोड करें और जाँचें

डाउनलोड करें और पहचाना गया टेक्स्ट मूल स्कैन से जाँचें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF में टेक्स्ट पहचानें (OCR), चरण 3: डाउनलोड करें और पहचाना गया टेक्स्ट मूल स्कैन से जाँचें।

स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।

केवल चित्र वाली जाँच सूची खोजने योग्य बनाई गई

स्रोत पृष्ठ एक चित्र है, जिससे टेक्स्ट नहीं निकाला जा सकता। OCR पृष्ठ का दृश्य रूप रखते हुए टेक्स्ट परत जोड़ता है। इसलिए दोनों चित्र एक जैसे दिखते हैं; डाउनलोड परिणाम में पहचाने हुए शब्द भी हैं।

पहले: केवल चित्र वाला पृष्ठ

स्रोत से टेक्स्ट निकालने पर शून्य अक्षर मिले।

OCR से पहले की वास्तविक चित्रमात्र जाँच सूची, जिसमें चयन योग्य टेक्स्ट परत नहीं है।

बाद में: वही पृष्ठ, खोजने योग्य टेक्स्ट

परिणाम में सभी छह पंक्तियों का पहचाना हुआ टेक्स्ट है। पाँच पंक्तियाँ स्रोत से पूरी तरह मेल खाती हैं; अंतिम पंक्ति में OCR को 00१ पढ़ा गया। जाँचे गए 1,300-पिक्सेल चित्र आकार पर प्रदर्शित पिक्सेल स्रोत से मेल खाते हैं।

वास्तविक खोजने योग्य परिणाम PDF में वही दिखाई देने वाली जाँच सूची और नई टेक्स्ट परत।
स्रोत टेक्स्ट
0 अक्षर
परिणाम टेक्स्ट
193 अक्षर (पंक्ति विराम सहित)
पहचान की जाँच
6 पंक्तियाँ पहचानी गईं; 5 पंक्तियाँ पूरी तरह मेल खाती हैं
इस परिणाम से निकाला गया टेक्स्ट पढ़ें
कार्यशाला की जाँच सूची
कमरे की बुकिंग पक्की करें।
प्रशिक्षण सामग्री की चालीस प्रतियाँ छापें।
प्रोजेक्टर सुबह 09:00 से पहले जाँचें।
उपस्थिति की अंतिम सूची सहेजें।
यह 00१ का एक हानिरहित नमूना है।

इस्तेमाल की गई सेटिंग: पृष्ठ 1; खोजने योग्य PDF; 200 DPI पहचान; टेक्स्ट का एक खंड; हिन्दी; मूल दिशा।

स्पष्ट और बड़े अक्षरों वाला यह अंग्रेज़ी नमूना छोटे अक्षरों, हस्तलिपि, तिरछे स्कैन या अन्य भाषाओं की सटीकता का मापदंड नहीं है। अपने परिणाम में नाम, राशियाँ और तारीखें जाँचें। इस नमूने की अंतिम पंक्ति में OCR संक्षेप को 00१ पढ़ा गया। नीचे वास्तविक निकाला गया टेक्स्ट दिया है; उपयोग से पहले ऐसी गलतियाँ स्रोत से मिलाकर सुधारें।

जाँच की तारीख: . इन उपकरणों से सुरक्षित नमूने स्थानीय Chromium ब्राउज़र में संसाधित किए गए। ये उदाहरण चालू होस्टिंग के प्रदर्शन का मापदंड नहीं हैं।

सेटिंग और आउटपुट की जाँच

सेटिंगक्या अपेक्षा रखें
स्वीकार्य इनपुटPDF
प्रसंस्करण का स्थानआपके डिवाइस पर आपका ब्राउज़र
फ़ाइल का चयनएक इनपुट फ़ाइल
इनपुट का आकारडिवाइस की मेमोरी और डिकोड किए गए पृष्ठों की सीमाओं के अधीन अधिकतम 100 MB
पहचान का बैचअधिकतम 20 चुने हुए पृष्ठ; खोजने योग्य PDF डाउनलोड में केवल वही पृष्ठ दिखाई देते हैं।

टूल टेक्स्ट परत जोड़ता है; यह तालिकाओं को संपादन योग्य स्प्रेडशीट में दोबारा नहीं बनाता और तथ्यों को ठीक नहीं करता। OCR नाम, खाता संख्या और अन्य सटीकता-संवेदनशील टेक्स्ट की समीक्षा का विकल्प नहीं है।

स्कैन बदले बिना पहचान की दिशा जाँचें

घुमाव सेटिंग पहचान को दिए जाने वाले प्रस्तुत स्कैन को घुमाती है; खोजने योग्य PDF में स्रोत पृष्ठ का दृश्य रूप बना रहता है। पाठकों को पृष्ठ सीधा दिखाना हो तो यह PDF घुमाएँ का विकल्प नहीं है। मौजूदा टेक्स्ट परत में त्रुटियाँ हों तो ज़बरन पहचान दूसरी परत जोड़ सकती है और दोहरे खोज परिणाम दे सकती है। उस स्थिति में सामान्य टेक्स्ट OCR जाँची हुई सामग्री निकालने के लिए उपयोगी हो सकता है। 0/O, 1/l और दशमलव बिंदुओं जैसे आसानी से गड़बड़ होने वाले वर्ण चित्र से मिलाएँ।

PDF में OCR की समस्याएँ

स्थितिक्या करें
नाम या संख्या गलत हैपहचाने गए टेक्स्ट को चित्र से मिलाएँ। दोबारा इस्तेमाल करने से पहले आगे के उपयुक्त संपादक में उसे ठीक करें।
मौजूदा खराब OCR परत नहीं सुधरीनई परत जोड़ने के लिए हर चुने हुए पृष्ठ की पहचान करें चुनें। मौजूदा टेक्स्ट रखा जाता है, इसलिए पहले की परत दोहरे खोज परिणाम दे सकती है; साफ़ सामग्री निकालनी हो तो सामान्य टेक्स्ट निर्यात करें।
लंबा दस्तावेज़ समूह अस्वीकार हो जाता हैउसे 20 या कम पृष्ठों के समूहों में बाँटें, हर समूह पर OCR करें और मिलाने से पहले उनकी जाँच करें।

व्यावहारिक उदाहरण और अंतिम जाँच

टाइप किए गए निरीक्षण पत्रक के लिए खोजने योग्य PDF में उपकरण का ज्ञात पहचानकर्ता खोजें, फिर उसे और एक माप को टेक्स्ट संपादक में कॉपी करें। दोनों को स्कैन से मिलाएँ और पुष्टि करें कि चयन सही पंक्ति उभारता हो। केवल सफल शब्द खोज से पढ़ने का सही क्रम या भरोसेमंद संख्यात्मक निष्कर्षण सिद्ध नहीं होता।

अक्सर पूछे जाने वाले प्रश्न

क्या OCR पृष्ठ को संपादन योग्य Word सामग्री में बदलता है?

आउटपुट अतिरिक्त टेक्स्ट परत वाला PDF ही रहता है। नए प्रवाह में व्यवस्थित टेक्स्ट दस्तावेज़ चाहिए तो बाद में PDF से Word इस्तेमाल करें।

कौन सी भाषाएँ उपलब्ध हैं?

इस संस्करण में अंग्रेज़ी, स्पेनिश, पुर्तगाली, जर्मन, इंडोनेशियाई, रूसी, फ़्रेंच, इतालवी, तुर्की, अरबी, सरलीकृत चीनी, जापानी, कोरियाई, पोलिश और हिन्दी के पहचान मॉडल शामिल हैं। अंग्रेज़ी डिफ़ॉल्ट है; स्रोत से मेल खाने वाली भाषा चुनें। OCR वर्ण पहचानता है, दस्तावेज़ का अनुवाद नहीं करता। अन्य भाषाओं के लिए अलग से कॉन्फ़िगर की गई OCR प्रक्रिया चाहिए।

कोई पृष्ठ क्यों छोड़ दिया गया?

डिफ़ॉल्ट सेटिंग मौजूदा टेक्स्ट परत वाले पृष्ठ रखती है। उन पर भी पहचान चलाने के लिए हर चुने हुए पृष्ठ की पहचान करें चुनें।

क्या आउटपुट में वे पृष्ठ भी हैं जिन्हें नहीं चुना?

नहीं। खोजने योग्य PDF में केवल चुने गए पृष्ठ होते हैं। लंबे दस्तावेज़ को साथ रखने के लिए अधिकतम 20 पृष्ठों के बैच में पहचान करें और जाँचे हुए आउटपुट मूल क्रम में मिलाएँ।

क्या पहचान का घुमाव दिखाई देने वाले PDF पृष्ठ को घुमाएगा?

नहीं। यह पहचान को दिए गए चित्र को घुमाता है, जबकि PDF में स्रोत पृष्ठ का दृश्य रूप बना रहता है। सहेजा गया पृष्ठ स्वयं सीधा दिखना चाहिए तो पहले PDF घुमाएँ इस्तेमाल करें।

क्या यह टूल हस्तलेखन भरोसेमंद ढंग से पढ़ सकता है या तालिकाएँ दोबारा बना सकता है?

टूल चुनी गई भाषा में टेक्स्ट पहचानता है; यह भरोसेमंद हस्तलेखन पहचान का वादा नहीं करता और तालिका के सेल दोबारा नहीं बनाता। साफ़, सीधा टाइप किया हुआ स्कैन इस्तेमाल करें और Word या स्प्रेडशीट प्रक्रिया में ले जाने से पहले शब्द जाँचें।

संबंधित टूल और मार्गदर्शिकाएँ

आगे इनका इस्तेमाल करें: PDF से Word, PDF से टेक्स्ट, स्कैन से PDF। लंबे समय के भंडारण की आवश्यकताओं के लिए देखें: PDF से PDF/A; खोजने योग्य PDF अपने आप PDF/A नहीं होता।