खोजने योग्य PDF या TXT
पहचाने गए शब्द सामान्य टेक्स्ट के रूप में डाउनलोड करें या PDF में स्कैन का रूप बनाए रखते हुए उस पर टेक्स्ट परत जोड़ें।
मूल पृष्ठ रूप बनाए रखते हुए स्कैन खोजने योग्य बनाएँ।
फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।
अधिकतम 100 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं
दस्तावेज़ का पूर्वावलोकन यहाँ देखें। जोड़ी गई सामग्री के लिए यह स्थिति तय करने का मार्गदर्शन है; सहेजा परिणाम जाँचें।
अपने ब्राउज़र में चलने वाले Tesseract से स्कैन किए गए PDF में खोजने योग्य टेक्स्ट परत जोड़ें। स्रोत से मेल खाने वाली भाषा चुनें; डिफ़ॉल्ट रूप से अंग्रेज़ी चुनी होती है। समर्थित रीडर पहचाने गए शब्द खोज और चुन सकते हैं, जबकि स्कैन किए गए पृष्ठ का मूल रूप बना रहता है।
डिफ़ॉल्ट रूप से प्रक्रिया उन पृष्ठों को बनाए रखती है जिनमें पहले से टेक्स्ट है। हर चुने हुए पृष्ठ की पहचान भी कर सकते हैं; इससे नई परत जुड़ती है और मौजूदा टेक्स्ट दोहर सकता है। OCR की शुद्धता फ़ोकस, कंट्रास्ट, भाषा और पृष्ठ संरेखण पर निर्भर करती है। छोटे अक्षरों, हस्तलेखन, असामान्य फ़ॉन्ट और धब्बों वाले स्कैन पर अपने आप भरोसा करने के बजाय सावधानीपूर्वक समीक्षा आवश्यक है।
पहचाने गए शब्द सामान्य टेक्स्ट के रूप में डाउनलोड करें या PDF में स्कैन का रूप बनाए रखते हुए उस पर टेक्स्ट परत जोड़ें।
डाउनलोड में केवल चुने गए पृष्ठ होते हैं। अधिकतम 20 पृष्ठ चुनें; पूरा दस्तावेज़ शामिल करने के लिए पृष्ठ फ़ील्ड केवल तभी खाली छोड़ें जब उसमें 20 या कम पृष्ठ हों।
स्रोत भाषा, 200 या 300 DPI, पहचान के लिए घुमाव और स्वचालित, एकल खंड या बिखरे टेक्स्ट वाला पृष्ठ लेआउट चुनें। समर्थित भाषाएँ नीचे के अक्सर पूछे जाने वाले प्रश्नों में दी गई हैं।
पहले से टेक्स्ट वाले पृष्ठ बनाए रखे जा सकते हैं। टेक्स्ट परत दोहरने की संभावना पर विचार करने के बाद ही ज़बरन पहचान चलाएँ।
स्कैन पृष्ठ को तस्वीर के रूप में सहेजता है, इसलिए सामान्य टेक्स्ट खोज उस पर छपे शब्द नहीं ढूँढ़ सकती। चुनी गई भाषा में OCR टाइप किए गए स्कैन को खोजने योग्य बना सकता है और कॉपी-पेस्ट या बाद में टेक्स्ट निकालने के लिए शब्द दे सकता है। यह उन अभिलेखों के लिए विशेष रूप से उपयोगी है जहाँ पृष्ठ का डिज़ाइन बदलने से अधिक ज्ञात नाम या वाक्यांश खोजना महत्वपूर्ण हो। स्कैन साफ़ दिखने पर भी पहचानी गई परत में गलतियाँ हो सकती हैं। खोज और चयन जाँचें, फिर निकाले गए शब्द इस्तेमाल करने से पहले नाम, संदर्भ और संख्याएँ पृष्ठ चित्र से मिलाएँ।
छोटे टाइप किए गए रिकॉर्ड को शीर्षक, नाम या संदर्भ संख्या से खोजने योग्य बनाएँ। मूल स्कैन सँभालें और डाउनलोड की गई प्रति में उन शब्दों की खोज जाँचें, जिसमें आसानी से गड़बड़ होने वाले वर्ण भी शामिल हों।
अध्ययन नोट्स बनाने से पहले टाइप किए गए पाठ्यक्रम नोट्स खोजने योग्य बनाएँ। हाथ से लिखी टिप्पणियाँ अविश्वसनीय रह सकती हैं, इसलिए उद्धृत अंश स्कैन से मिलाएँ।
आंतरिक सूचकांक के लिए स्वीकृत स्कैन किए गए ज्ञापन से शब्द निकालें। तारीखें, कर्मचारियों के नाम और संदर्भ संख्याएँ सावधानी से मिलाएँ, क्योंकि एक पहचाना गया वर्ण भी पहचानकर्ता बदल सकता है।
समर्थित भाषा वाला स्कैन चुनें और अधिकतम 20 पृष्ठ चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
स्रोत भाषा, OCR परिणाम, रिज़ॉल्यूशन, लेआउट और पहचान की दिशा चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
डाउनलोड करें और पहचाना गया टेक्स्ट मूल स्कैन से जाँचें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।
स्रोत पृष्ठ एक चित्र है, जिससे टेक्स्ट नहीं निकाला जा सकता। OCR पृष्ठ का दृश्य रूप रखते हुए टेक्स्ट परत जोड़ता है। इसलिए दोनों चित्र एक जैसे दिखते हैं; डाउनलोड परिणाम में पहचाने हुए शब्द भी हैं।
स्रोत से टेक्स्ट निकालने पर शून्य अक्षर मिले।

परिणाम में सभी छह पंक्तियों का पहचाना हुआ टेक्स्ट है। पाँच पंक्तियाँ स्रोत से पूरी तरह मेल खाती हैं; अंतिम पंक्ति में OCR को 00१ पढ़ा गया। जाँचे गए 1,300-पिक्सेल चित्र आकार पर प्रदर्शित पिक्सेल स्रोत से मेल खाते हैं।

कार्यशाला की जाँच सूची कमरे की बुकिंग पक्की करें। प्रशिक्षण सामग्री की चालीस प्रतियाँ छापें। प्रोजेक्टर सुबह 09:00 से पहले जाँचें। उपस्थिति की अंतिम सूची सहेजें। यह 00१ का एक हानिरहित नमूना है।
इस्तेमाल की गई सेटिंग: पृष्ठ 1; खोजने योग्य PDF; 200 DPI पहचान; टेक्स्ट का एक खंड; हिन्दी; मूल दिशा।
स्पष्ट और बड़े अक्षरों वाला यह अंग्रेज़ी नमूना छोटे अक्षरों, हस्तलिपि, तिरछे स्कैन या अन्य भाषाओं की सटीकता का मापदंड नहीं है। अपने परिणाम में नाम, राशियाँ और तारीखें जाँचें। इस नमूने की अंतिम पंक्ति में OCR संक्षेप को 00१ पढ़ा गया। नीचे वास्तविक निकाला गया टेक्स्ट दिया है; उपयोग से पहले ऐसी गलतियाँ स्रोत से मिलाकर सुधारें।
जाँच की तारीख: . इन उपकरणों से सुरक्षित नमूने स्थानीय Chromium ब्राउज़र में संसाधित किए गए। ये उदाहरण चालू होस्टिंग के प्रदर्शन का मापदंड नहीं हैं।
| सेटिंग | क्या अपेक्षा रखें |
|---|---|
| स्वीकार्य इनपुट | |
| प्रसंस्करण का स्थान | आपके डिवाइस पर आपका ब्राउज़र |
| फ़ाइल का चयन | एक इनपुट फ़ाइल |
| इनपुट का आकार | डिवाइस की मेमोरी और डिकोड किए गए पृष्ठों की सीमाओं के अधीन अधिकतम 100 MB |
| पहचान का बैच | अधिकतम 20 चुने हुए पृष्ठ; खोजने योग्य PDF डाउनलोड में केवल वही पृष्ठ दिखाई देते हैं। |
टूल टेक्स्ट परत जोड़ता है; यह तालिकाओं को संपादन योग्य स्प्रेडशीट में दोबारा नहीं बनाता और तथ्यों को ठीक नहीं करता। OCR नाम, खाता संख्या और अन्य सटीकता-संवेदनशील टेक्स्ट की समीक्षा का विकल्प नहीं है।
घुमाव सेटिंग पहचान को दिए जाने वाले प्रस्तुत स्कैन को घुमाती है; खोजने योग्य PDF में स्रोत पृष्ठ का दृश्य रूप बना रहता है। पाठकों को पृष्ठ सीधा दिखाना हो तो यह PDF घुमाएँ का विकल्प नहीं है। मौजूदा टेक्स्ट परत में त्रुटियाँ हों तो ज़बरन पहचान दूसरी परत जोड़ सकती है और दोहरे खोज परिणाम दे सकती है। उस स्थिति में सामान्य टेक्स्ट OCR जाँची हुई सामग्री निकालने के लिए उपयोगी हो सकता है। 0/O, 1/l और दशमलव बिंदुओं जैसे आसानी से गड़बड़ होने वाले वर्ण चित्र से मिलाएँ।
| स्थिति | क्या करें |
|---|---|
| नाम या संख्या गलत है | पहचाने गए टेक्स्ट को चित्र से मिलाएँ। दोबारा इस्तेमाल करने से पहले आगे के उपयुक्त संपादक में उसे ठीक करें। |
| मौजूदा खराब OCR परत नहीं सुधरी | नई परत जोड़ने के लिए हर चुने हुए पृष्ठ की पहचान करें चुनें। मौजूदा टेक्स्ट रखा जाता है, इसलिए पहले की परत दोहरे खोज परिणाम दे सकती है; साफ़ सामग्री निकालनी हो तो सामान्य टेक्स्ट निर्यात करें। |
| लंबा दस्तावेज़ समूह अस्वीकार हो जाता है | उसे 20 या कम पृष्ठों के समूहों में बाँटें, हर समूह पर OCR करें और मिलाने से पहले उनकी जाँच करें। |
टाइप किए गए निरीक्षण पत्रक के लिए खोजने योग्य PDF में उपकरण का ज्ञात पहचानकर्ता खोजें, फिर उसे और एक माप को टेक्स्ट संपादक में कॉपी करें। दोनों को स्कैन से मिलाएँ और पुष्टि करें कि चयन सही पंक्ति उभारता हो। केवल सफल शब्द खोज से पढ़ने का सही क्रम या भरोसेमंद संख्यात्मक निष्कर्षण सिद्ध नहीं होता।
आउटपुट अतिरिक्त टेक्स्ट परत वाला PDF ही रहता है। नए प्रवाह में व्यवस्थित टेक्स्ट दस्तावेज़ चाहिए तो बाद में PDF से Word इस्तेमाल करें।
इस संस्करण में अंग्रेज़ी, स्पेनिश, पुर्तगाली, जर्मन, इंडोनेशियाई, रूसी, फ़्रेंच, इतालवी, तुर्की, अरबी, सरलीकृत चीनी, जापानी, कोरियाई, पोलिश और हिन्दी के पहचान मॉडल शामिल हैं। अंग्रेज़ी डिफ़ॉल्ट है; स्रोत से मेल खाने वाली भाषा चुनें। OCR वर्ण पहचानता है, दस्तावेज़ का अनुवाद नहीं करता। अन्य भाषाओं के लिए अलग से कॉन्फ़िगर की गई OCR प्रक्रिया चाहिए।
डिफ़ॉल्ट सेटिंग मौजूदा टेक्स्ट परत वाले पृष्ठ रखती है। उन पर भी पहचान चलाने के लिए हर चुने हुए पृष्ठ की पहचान करें चुनें।
नहीं। खोजने योग्य PDF में केवल चुने गए पृष्ठ होते हैं। लंबे दस्तावेज़ को साथ रखने के लिए अधिकतम 20 पृष्ठों के बैच में पहचान करें और जाँचे हुए आउटपुट मूल क्रम में मिलाएँ।
नहीं। यह पहचान को दिए गए चित्र को घुमाता है, जबकि PDF में स्रोत पृष्ठ का दृश्य रूप बना रहता है। सहेजा गया पृष्ठ स्वयं सीधा दिखना चाहिए तो पहले PDF घुमाएँ इस्तेमाल करें।
टूल चुनी गई भाषा में टेक्स्ट पहचानता है; यह भरोसेमंद हस्तलेखन पहचान का वादा नहीं करता और तालिका के सेल दोबारा नहीं बनाता। साफ़, सीधा टाइप किया हुआ स्कैन इस्तेमाल करें और Word या स्प्रेडशीट प्रक्रिया में ले जाने से पहले शब्द जाँचें।
आगे इनका इस्तेमाल करें: PDF से Word, PDF से टेक्स्ट, स्कैन से PDF। लंबे समय के भंडारण की आवश्यकताओं के लिए देखें: PDF से PDF/A; खोजने योग्य PDF अपने आप PDF/A नहीं होता।