मौजूदा टेक्स्ट निकालें
स्कैन किए गए चित्रों में अक्षर पहचानने के बजाय दस्तावेज़ की चुनने योग्य टेक्स्ट परत पढ़ें।
मौजूदा टेक्स्ट परत को UTF-8 टेक्स्ट फ़ाइल में निकालें।
फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।
अधिकतम 100 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं
दस्तावेज़ का पूर्वावलोकन यहाँ देखें। जोड़ी गई सामग्री के लिए यह स्थिति तय करने का मार्गदर्शन है; सहेजा परिणाम जाँचें।
खोजने, कॉपी करने या आगे संपादित करने के लिए PDF की मौजूदा टेक्स्ट परत निकालें। पंक्तियाँ पृष्ठ पर उनकी स्थिति के आधार पर समूहित होती हैं। यह विशेष रूप से टेक्स्ट प्रधान रिपोर्ट और दस्तावेज़ अभिलेखों के लिए उपयोगी है।
आउटपुट में फ़ॉन्ट, चित्र या पृष्ठ डिज़ाइन के बिना सामान्य टेक्स्ट होता है। कई स्तंभों वाले पृष्ठों में पढ़ने का क्रम दृश्य लेआउट से अलग हो सकता है। बिना टेक्स्ट परत वाले स्कैन किए गए पृष्ठ का टेक्स्ट यह प्रक्रिया नहीं पहचान सकती।
स्कैन किए गए चित्रों में अक्षर पहचानने के बजाय दस्तावेज़ की चुनने योग्य टेक्स्ट परत पढ़ें।
पृष्ठ फ़ील्ड का उपयोग करके निर्यात को अध्याय, पत्र या परिशिष्ट तक सीमित रखें।
सामान्य टेक्स्ट फ़ाइल डाउनलोड करें, जो वर्ड प्रोसेसिंग लेआउट के बिना आम टेक्स्ट संपादकों में खुलती है।
पास-पास के टेक्स्ट अंशों को पंक्तियों में समूहित किया जाता है। कई स्तंभों में पढ़ने का क्रम फिर भी पृष्ठ से मिलाकर जाँचना पड़ता है।
जब मुद्रित लेआउट से अधिक शब्द मायने रखते हों, तब सामान्य टेक्स्ट उपयोगी है। इससे स्थानीय फ़ोल्डर में खोज सकते हैं, शब्द संपादक में कॉपी कर सकते हैं या नोट्स बनाने के लिए साफ़ शुरुआत तैयार कर सकते हैं। यह टेक्स्ट के काम में भारी चित्रों वाला पृष्ठ डिज़ाइन लाने से भी बचाता है। टेक्स्ट परत हमेशा पृष्ठ पर दिखने वाले शब्दों जैसी नहीं होती: संयुक्त अक्षर, छिपी OCR त्रुटियाँ और स्तंभों का क्रम निर्यात बदल सकते हैं। आगे काम में परिणाम इस्तेमाल करने से पहले कुछ प्रतिनिधि अनुच्छेद और महत्वपूर्ण नाम या संख्याएँ जाँचें।
उद्धरण एकत्र करने और पठन नोट्स बनाने के लिए अनुमत लेख का टेक्स्ट निर्यात करें। हर उद्धरण को उसके स्रोत पृष्ठ से मिलाएँ और पृष्ठ संख्या अलग से लिखें।
संशोधित मसौदे के लिए मानक पत्र के शब्द टेक्स्ट संपादक में लाएँ। संगठन के टेम्पलेट में डालने से पहले संबोधन, तारीखें और पंक्ति विभाजन जाँचें।
खोजने योग्य कार्य नोट के लिए विनिर्देशों के शब्द प्राप्त करें। इकाइयाँ, चिह्न और क्रमांकित चरण PDF से मिलाएँ, क्योंकि असामान्य फ़ॉन्ट एन्कोडिंग निकाले गए वर्ण बदल सकती है।
पहले से चयन योग्य टेक्स्ट परत वाला PDF चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
पृष्ठ और चाहें तो डाउनलोड का नाम चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
TXT फ़ाइल डाउनलोड करें और उसके शब्द PDF से सत्यापित करें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।
| सेटिंग | क्या अपेक्षा रखें |
|---|---|
| स्वीकार्य इनपुट | |
| प्रसंस्करण का स्थान | आपका ब्राउज़र |
| फ़ाइल का चयन | एक इनपुट फ़ाइल |
| इनपुट का आकार | कुल 100 MB; डिकोड किए गए चित्रों और पृष्ठों की पिक्सेल सीमाएँ भी हैं |
| पृष्ठों का चयन | प्रति काम अधिकतम 200 चुने हुए पृष्ठ। पृष्ठ फ़ील्ड खाली छोड़ने का अर्थ सभी पृष्ठ तभी है जब PDF में 200 या कम पृष्ठ हों; लंबे दस्तावेज़ के लिए अलग-अलग सीमाएँ इस्तेमाल करें। |
पृष्ठ स्कैन होने के कारण कोई शब्द चुना न जा सके तो टेक्स्ट निकालने से पहले OCR टेक्स्ट परत जोड़कर जाँचें।
PDF के भीतर टेक्स्ट अंशों का क्रम उनकी दिखाई देने वाली स्थिति से अलग हो सकता है। साइडबार, पादटिप्पणियाँ और दो स्तंभों वाला लेआउट निर्यात किए गए वाक्य के बीच रुकावट आने के सामान्य कारण हैं। दिखाई देने वाला अक्षर ऐसी फ़ॉन्ट मैपिंग पर भी निर्भर हो सकता है जो निकालते समय वही वर्ण न दे। स्तंभ या पृष्ठ की सीमा पार करने वाले अनुच्छेद की तुलना करें और TXT को भरोसेमंद स्रोत मानने से पहले तकनीकी चिह्न तथा “fi” जैसे संयुक्त अक्षर जाँचें।
| स्थिति | क्या करें |
|---|---|
| टेक्स्ट फ़ाइल खाली है या रूपांतरण अस्वीकार हो जाता है | चुने गए पृष्ठों में टेक्स्ट परत नहीं हो सकती। उपलब्ध हो तो पहले OCR इस्तेमाल करें। |
| कुछ अक्षर गलत हैं | PDF की टेक्स्ट एन्कोडिंग या OCR परत में त्रुटि हो सकती है। नाम, संख्याएँ और चिह्न दिखाई देने वाले पृष्ठ से मिलाएँ। |
| आपको संपादन योग्य स्वरूपित दस्तावेज़ चाहिए | DOCX की शुरुआती प्रति के लिए PDF से Word इस्तेमाल करें; सटीक लेआउट की समीक्षा फिर भी आवश्यक है। |
कल्पना करें कि दो स्तंभों में बाईं ओर A1, A2 और दाईं ओर B1, B2 हैं। स्थिति आधारित समूह बनाने से पहले A1 B1 और फिर A2 B2मिल सकते हैं, जिससे स्तंभ मिश्रित हो जाते हैं। निकाली गई पंक्तियों का क्रम बदलने से पहले PDF में हर स्तंभ पढ़ें; साफ़ दिखने वाली टेक्स्ट फ़ाइल भी असंबंधित वाक्यों को जोड़ सकती है।
पहचाना गया टेक्स्ट जोड़ने के लिए पहले OCR चलाएँ। केवल चित्रों वाला स्रोत चुनने पर टेक्स्ट न होने का स्पष्ट संदेश मिलता है।
स्थिति के आधार पर पंक्तियों का समूह पंक्तियों के क्रम का अनुमान लगाता है। अनुच्छेद विभाजन और जटिल स्तंभों को संपादकीय समीक्षा चाहिए।
चुने गए पृष्ठों का टेक्स्ट खाली पंक्तियों के साथ जोड़ा जाता है। PDF में सटीक संदर्भ देने हों तो अपने नोट्स में वास्तविक पृष्ठ सीमा रखें।
आगे इनका इस्तेमाल करें: PDF में टेक्स्ट पहचानें (OCR), PDF रीडर। किसी दूसरी भाषा में आउटपुट के लिए पढ़ें: PDF अनुवाद की प्रक्रिया; टेक्स्ट निकालने की प्रक्रिया खुद अनुवाद नहीं करती।