PDF से टेक्स्ट

मौजूदा टेक्स्ट परत को UTF-8 टेक्स्ट फ़ाइल में निकालें।

PDF फ़ाइलें चुनें

फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।

अधिकतम 100 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं

विषय सूचीअनुभाग: 11

PDF से सामान्य टेक्स्ट के रूप में क्या निकाला जा सकता है?

खोजने, कॉपी करने या आगे संपादित करने के लिए PDF की मौजूदा टेक्स्ट परत निकालें। पंक्तियाँ पृष्ठ पर उनकी स्थिति के आधार पर समूहित होती हैं। यह विशेष रूप से टेक्स्ट प्रधान रिपोर्ट और दस्तावेज़ अभिलेखों के लिए उपयोगी है।

आउटपुट में फ़ॉन्ट, चित्र या पृष्ठ डिज़ाइन के बिना सामान्य टेक्स्ट होता है। कई स्तंभों वाले पृष्ठों में पढ़ने का क्रम दृश्य लेआउट से अलग हो सकता है। बिना टेक्स्ट परत वाले स्कैन किए गए पृष्ठ का टेक्स्ट यह प्रक्रिया नहीं पहचान सकती।

PDF से टेक्स्ट की सुविधाएँ

मौजूदा टेक्स्ट निकालें

स्कैन किए गए चित्रों में अक्षर पहचानने के बजाय दस्तावेज़ की चुनने योग्य टेक्स्ट परत पढ़ें।

संबंधित पृष्ठ चुनें

पृष्ठ फ़ील्ड का उपयोग करके निर्यात को अध्याय, पत्र या परिशिष्ट तक सीमित रखें।

आसानी से इस्तेमाल होने वाला TXT आउटपुट

सामान्य टेक्स्ट फ़ाइल डाउनलोड करें, जो वर्ड प्रोसेसिंग लेआउट के बिना आम टेक्स्ट संपादकों में खुलती है।

स्थिति के आधार पर पंक्तियों का समूह

पास-पास के टेक्स्ट अंशों को पंक्तियों में समूहित किया जाता है। कई स्तंभों में पढ़ने का क्रम फिर भी पृष्ठ से मिलाकर जाँचना पड़ता है।

PDF के शब्दों को टेक्स्ट फ़ाइल में क्यों बदलें?

जब मुद्रित लेआउट से अधिक शब्द मायने रखते हों, तब सामान्य टेक्स्ट उपयोगी है। इससे स्थानीय फ़ोल्डर में खोज सकते हैं, शब्द संपादक में कॉपी कर सकते हैं या नोट्स बनाने के लिए साफ़ शुरुआत तैयार कर सकते हैं। यह टेक्स्ट के काम में भारी चित्रों वाला पृष्ठ डिज़ाइन लाने से भी बचाता है। टेक्स्ट परत हमेशा पृष्ठ पर दिखने वाले शब्दों जैसी नहीं होती: संयुक्त अक्षर, छिपी OCR त्रुटियाँ और स्तंभों का क्रम निर्यात बदल सकते हैं। आगे काम में परिणाम इस्तेमाल करने से पहले कुछ प्रतिनिधि अनुच्छेद और महत्वपूर्ण नाम या संख्याएँ जाँचें।

PDF से निकाला गया टेक्स्ट कौन इस्तेमाल करता है?

विश्वविद्यालय के शोधकर्ता

उद्धरण एकत्र करने और पठन नोट्स बनाने के लिए अनुमत लेख का टेक्स्ट निर्यात करें। हर उद्धरण को उसके स्रोत पृष्ठ से मिलाएँ और पृष्ठ संख्या अलग से लिखें।

प्रशासनिक कर्मचारी

संशोधित मसौदे के लिए मानक पत्र के शब्द टेक्स्ट संपादक में लाएँ। संगठन के टेम्पलेट में डालने से पहले संबोधन, तारीखें और पंक्ति विभाजन जाँचें।

तकनीकी लेखक

खोजने योग्य कार्य नोट के लिए विनिर्देशों के शब्द प्राप्त करें। इकाइयाँ, चिह्न और क्रमांकित चरण PDF से मिलाएँ, क्योंकि असामान्य फ़ॉन्ट एन्कोडिंग निकाले गए वर्ण बदल सकती है।

PDF से टेक्स्ट कैसे निकालें?

  1. चुनने योग्य टेक्स्ट वाला PDF चुनें। केवल चित्रों वाला स्कैन हो तो पहले OCR से टेक्स्ट परत बनाएँ।
  2. निकालने वाले पृष्ठ दर्ज करें या पूरे दस्तावेज़ के लिए पृष्ठ फ़ील्ड खाली छोड़ें। उपयोगी हो तो डाउनलोड नाम जोड़ें।
  3. टेक्स्ट निकालने की प्रक्रिया चलाएँ और TXT फ़ाइल डाउनलोड करें। उसे टेक्स्ट संपादक में खोलें।
  4. टेक्स्ट संपादित करने या उद्धृत करने से पहले अनुच्छेदों का क्रम, विराम चिह्न, नाम और महत्वपूर्ण संख्याएँ मूल PDF से मिलाएँ।

स्रोत फ़ाइल चुनें

पहले से चयन योग्य टेक्स्ट परत वाला PDF चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से टेक्स्ट, चरण 1: पहले से चयन योग्य टेक्स्ट परत वाला PDF चुनें।

टूल की सेटिंग जाँचें

पृष्ठ और चाहें तो डाउनलोड का नाम चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से टेक्स्ट, चरण 2: पृष्ठ और चाहें तो डाउनलोड का नाम चुनें।

परिणाम डाउनलोड करें और जाँचें

TXT फ़ाइल डाउनलोड करें और उसके शब्द PDF से सत्यापित करें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से टेक्स्ट, चरण 3: TXT फ़ाइल डाउनलोड करें और उसके शब्द PDF से सत्यापित करें।

स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।

सेटिंग और आउटपुट की जाँच

सेटिंगक्या अपेक्षा रखें
स्वीकार्य इनपुटPDF
प्रसंस्करण का स्थानआपका ब्राउज़र
फ़ाइल का चयनएक इनपुट फ़ाइल
इनपुट का आकारकुल 100 MB; डिकोड किए गए चित्रों और पृष्ठों की पिक्सेल सीमाएँ भी हैं
पृष्ठों का चयनप्रति काम अधिकतम 200 चुने हुए पृष्ठ। पृष्ठ फ़ील्ड खाली छोड़ने का अर्थ सभी पृष्ठ तभी है जब PDF में 200 या कम पृष्ठ हों; लंबे दस्तावेज़ के लिए अलग-अलग सीमाएँ इस्तेमाल करें।

पृष्ठ स्कैन होने के कारण कोई शब्द चुना न जा सके तो टेक्स्ट निकालने से पहले OCR टेक्स्ट परत जोड़कर जाँचें।

पढ़ने का क्रम और एन्कोड किए गए वर्ण जाँचें

PDF के भीतर टेक्स्ट अंशों का क्रम उनकी दिखाई देने वाली स्थिति से अलग हो सकता है। साइडबार, पादटिप्पणियाँ और दो स्तंभों वाला लेआउट निर्यात किए गए वाक्य के बीच रुकावट आने के सामान्य कारण हैं। दिखाई देने वाला अक्षर ऐसी फ़ॉन्ट मैपिंग पर भी निर्भर हो सकता है जो निकालते समय वही वर्ण न दे। स्तंभ या पृष्ठ की सीमा पार करने वाले अनुच्छेद की तुलना करें और TXT को भरोसेमंद स्रोत मानने से पहले तकनीकी चिह्न तथा “fi” जैसे संयुक्त अक्षर जाँचें।

PDF से टेक्स्ट में आने वाली समस्याएँ

स्थितिक्या करें
टेक्स्ट फ़ाइल खाली है या रूपांतरण अस्वीकार हो जाता हैचुने गए पृष्ठों में टेक्स्ट परत नहीं हो सकती। उपलब्ध हो तो पहले OCR इस्तेमाल करें।
कुछ अक्षर गलत हैंPDF की टेक्स्ट एन्कोडिंग या OCR परत में त्रुटि हो सकती है। नाम, संख्याएँ और चिह्न दिखाई देने वाले पृष्ठ से मिलाएँ।
आपको संपादन योग्य स्वरूपित दस्तावेज़ चाहिएDOCX की शुरुआती प्रति के लिए PDF से Word इस्तेमाल करें; सटीक लेआउट की समीक्षा फिर भी आवश्यक है।

व्यावहारिक उदाहरण और अंतिम जाँच

कल्पना करें कि दो स्तंभों में बाईं ओर A1, A2 और दाईं ओर B1, B2 हैं। स्थिति आधारित समूह बनाने से पहले A1 B1 और फिर A2 B2मिल सकते हैं, जिससे स्तंभ मिश्रित हो जाते हैं। निकाली गई पंक्तियों का क्रम बदलने से पहले PDF में हर स्तंभ पढ़ें; साफ़ दिखने वाली टेक्स्ट फ़ाइल भी असंबंधित वाक्यों को जोड़ सकती है।

अक्सर पूछे जाने वाले प्रश्न

क्या स्कैन किए गए PDF से टेक्स्ट निकाल सकते हैं?

पहचाना गया टेक्स्ट जोड़ने के लिए पहले OCR चलाएँ। केवल चित्रों वाला स्रोत चुनने पर टेक्स्ट न होने का स्पष्ट संदेश मिलता है।

क्या टूल अनुच्छेद बनाए रखता है?

स्थिति के आधार पर पंक्तियों का समूह पंक्तियों के क्रम का अनुमान लगाता है। अनुच्छेद विभाजन और जटिल स्तंभों को संपादकीय समीक्षा चाहिए।

टेक्स्ट डाउनलोड में पृष्ठ कैसे अलग किए जाते हैं?

चुने गए पृष्ठों का टेक्स्ट खाली पंक्तियों के साथ जोड़ा जाता है। PDF में सटीक संदर्भ देने हों तो अपने नोट्स में वास्तविक पृष्ठ सीमा रखें।

संबंधित टूल और मार्गदर्शिकाएँ

आगे इनका इस्तेमाल करें: PDF में टेक्स्ट पहचानें (OCR), PDF रीडर। किसी दूसरी भाषा में आउटपुट के लिए पढ़ें: PDF अनुवाद की प्रक्रिया; टेक्स्ट निकालने की प्रक्रिया खुद अनुवाद नहीं करती।