PDF से HTML

PDF की टेक्स्ट परत से सरल HTML दस्तावेज़ बनाएँ।

PDF फ़ाइलें चुनें

फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।

अधिकतम 100 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं

विषय सूचीअनुभाग: 11

PDF के टेक्स्ट का HTML निर्यात क्या शामिल करता है?

चुनने योग्य PDF टेक्स्ट को सरल HTML दस्तावेज़ में निर्यात करें, जिसमें हर चुने हुए पृष्ठ के लिए एक खंड हो। परिणाम पढ़ने योग्य टेक्स्ट संदर्भ या वेब संपादन की शुरुआत के रूप में उपयोगी है।

टूल निकाले गए वर्णों को HTML के लिए सुरक्षित रूप में बदलता है और इंटरैक्टिव PDF सामग्री या मूल CSS दोबारा नहीं बनाता। परिणाम टेक्स्ट का रूप है, PDF से पिक्सेल-दर-पिक्सेल मेल खाने वाला वेबसाइट संस्करण नहीं।

PDF से HTML की सुविधाएँ

हर स्रोत पृष्ठ के लिए एक खंड

HTML चुने गए स्रोत पृष्ठों के लेबल देता है, ताकि पाठक संबंधित PDF पृष्ठ पर लौट सके।

सुरक्षित रूप में बदली गई टेक्स्ट सामग्री

निकाले गए वर्णों को HTML के लिए एस्केप किया जाता है। PDF टेक्स्ट एम्बेड किए गए HTML कोड के रूप में नहीं चलाया जाता।

चुने हुए पृष्ठों का निर्यात

केवल अपने काम से संबंधित पृष्ठ चुनकर छोटा संदर्भ दस्तावेज़ बनाएँ।

ब्राउज़र में पढ़ने योग्य सरल फ़ाइल

डाउनलोड HTML टेक्स्ट दस्तावेज़ के रूप में खुलता है। यह स्रोत के फ़ॉन्ट, चित्र या पृष्ठ का CSS दोबारा नहीं बनाता।

PDF का HTML टेक्स्ट संस्करण क्यों बनाएँ?

HTML निकाले गए शब्दों को ब्राउज़र में देखने या वेब संपादक को देने के लिए सुविधाजनक बना सकता है। यह कनवर्टर पृष्ठ लेबल वाले टेक्स्ट खंड बनाता है, जो प्रकाशक द्वारा उचित वेबपृष्ठ तैयार करते समय संदर्भ के लिए उपयोगी हैं। यह अर्थ के अनुसार शीर्षक नहीं पहचानता, तालिकाएँ दोबारा नहीं बनाता और पूरी तरह सुलभ प्रकाशन नहीं देता। रूपांतरण के बाद सामग्री को अर्थपूर्ण शीर्षकों और अनुच्छेदों में व्यवस्थित करें, पढ़ने का क्रम जाँचें और अनुमत चित्र अलग से जोड़ें। आवश्यकता स्थिर दृश्य पूर्वावलोकन की हो तो पृष्ठ प्रस्तुति इस्तेमाल करें।

PDF से HTML टेक्स्ट निर्यात कौन इस्तेमाल करता है?

वेब सामग्री संपादक

वेबपृष्ठ के मसौदे के लिए स्वीकृत विवरणिका के शब्द प्राप्त करें। सामान्य पृष्ठ खंडों की जगह अर्थपूर्ण शीर्षक लगाएँ और सुनिश्चित करें कि पंक्ति विभाजन ने वाक्यों को तोड़ा न हो।

आंतरिक ज्ञान संग्रह की देखरेख करने वाले

टेक्स्ट प्रधान PDF प्रक्रिया से ब्राउज़र में पढ़ने योग्य संदर्भ बनाएँ। टीम की प्रणाली के लिए समीक्षित लेख तैयार करते समय स्रोत पृष्ठों के संदर्भ बनाए रखें।

डिजिटल प्रकाशन के विद्यार्थी

स्थिर PDF लेआउट की तुलना सरल HTML टेक्स्ट प्रस्तुति से करें। पहचानें कि उपयोगी वेब संस्करण के लिए कौन सी संरचना, चित्रों के विवरण और तालिका मार्कअप हाथ से जोड़ने होंगे।

PDF टेक्स्ट को HTML में कैसे बदलें?

  1. चुनने योग्य टेक्स्ट वाला अनएन्क्रिप्टेड PDF चुनें। पृष्ठ केवल चित्र हों तो पहले OCR इस्तेमाल करें।
  2. HTML संदर्भ के लिए पृष्ठ चुनें और चाहें तो डाउनलोड का नाम रखें।
  3. रूपांतरण करें और HTML फ़ाइल डाउनलोड करें, फिर उसे ब्राउज़र में खोलें।
  4. पृष्ठ खंड और टेक्स्ट का क्रम जाँचें। शब्दों को तैयार पृष्ठ के रूप में प्रकाशित करने से पहले वेब संपादक में अर्थपूर्ण संरचना बनाएँ।

स्रोत फ़ाइल चुनें

HTML में निकालने के लिए टेक्स्ट वाला PDF चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से HTML, चरण 1: HTML में निकालने के लिए टेक्स्ट वाला PDF चुनें।

टूल की सेटिंग जाँचें

स्रोत पृष्ठ और चाहें तो डाउनलोड का नाम तय करें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से HTML, चरण 2: स्रोत पृष्ठ और चाहें तो डाउनलोड का नाम तय करें।

परिणाम डाउनलोड करें और जाँचें

HTML डाउनलोड करें और पृष्ठ लेबल वाले टेक्स्ट खंड जाँचें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से HTML, चरण 3: HTML डाउनलोड करें और पृष्ठ लेबल वाले टेक्स्ट खंड जाँचें।

स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।

सेटिंग और आउटपुट की जाँच

सेटिंगक्या अपेक्षा रखें
स्वीकार्य इनपुटPDF
प्रसंस्करण का स्थानआपका ब्राउज़र
फ़ाइल का चयनएक इनपुट फ़ाइल
इनपुट का आकारकुल 100 MB; डिकोड किए गए चित्रों और पृष्ठों की पिक्सेल सीमाएँ भी हैं
पृष्ठों का चयनप्रति काम अधिकतम 200 चुने हुए पृष्ठ। पृष्ठ फ़ील्ड खाली छोड़ने का अर्थ सभी पृष्ठ तभी है जब PDF में 200 या कम पृष्ठ हों; लंबे दस्तावेज़ के लिए अलग-अलग सीमाएँ इस्तेमाल करें।

इस निर्यात को मौजूदा टेक्स्ट परत चाहिए। स्कैन किए गए पृष्ठों के शब्द बनाए गए HTML में आने से पहले जाँचा हुआ OCR आवश्यक है।

पृष्ठ खंडों को उपयोगी वेब संरचना में बदलें

मुद्रित पृष्ठ की सीमा शायद ही किसी पूरे वेब खंड की पहचान करती है। निर्यात संपादित करते समय अनुच्छेद ऐसे शीर्षकों के नीचे रखें जो उनका विषय बताएँ, वास्तविक तालिका को पंक्तियों और स्तंभों का उचित मार्कअप दें तथा महत्वपूर्ण आरेखों के लिए व्याख्यात्मक टेक्स्ट जोड़ें। बनाया गया पूर्वस्वरूपित टेक्स्ट संपादन का संदर्भ है, इसका प्रमाण नहीं कि मूल दस्तावेज़ अब तैयार वेबपृष्ठ बन गया है। स्रोत पृष्ठ लेबल हटाने से पहले शब्द PDF से मिलाएँ।

PDF से HTML में आने वाली समस्याएँ

स्थितिक्या करें
पृष्ठ का डिज़ाइन गायब हैयह PDF से टेक्स्ट का HTML में निर्यात है, दृश्य लेआउट का पुनर्निर्माण नहीं।
स्कैन किए गए पृष्ठ में सामग्री नहीं हैपहले OCR टेक्स्ट परत जोड़ें और जाँचें।
वर्ण HTML कोड जैसे दिखते हैंउन्हें जानबूझकर एस्केप किया जाता है, ताकि निकाली गई दस्तावेज़ सामग्री चलाई न जाए।

व्यावहारिक उदाहरण और अंतिम जाँच

“परियोजना योजना” जैसा मुद्रित शीर्षक निर्यात के pre टेक्स्ट में दिखाई दे सकता है। दस्तावेज़ का शीर्षक होने की पुष्टि के बाद संपादक उसे इस तरह चिह्नित कर सकता है: <h1>परियोजना योजना</h1> और उसके बाद का गद्य p तत्वों में रख सकता है। संरचना टेक्स्ट के अर्थ से चुनें, केवल इस आधार पर नहीं कि PDF पृष्ठ कहाँ समाप्त होता है।

अक्सर पूछे जाने वाले प्रश्न

क्या PDF के लिंक और चित्र बने रहते हैं?

इस निर्यात में एस्केप किया गया निकाला हुआ टेक्स्ट शामिल है। चित्र, सक्रिय लिंक और मूल पृष्ठ स्टाइल दोबारा नहीं बनाए जाते।

क्या HTML को तैयार वेबपृष्ठ के रूप में अपलोड कर सकते हैं?

पहले उसकी सामग्री, सुलभता और स्वरूपण की समीक्षा करें। निकाले गए टेक्स्ट को पूरी साइट मानने के बजाय उपयुक्त वेब लेआउट जोड़ें।

क्या निर्यात किए गए HTML को संपादित कर सकते हैं?

हाँ। डाउनलोड की गई फ़ाइल टेक्स्ट या HTML संपादक में खोलें। प्रकाशित पृष्ठ में इस्तेमाल करने से पहले निकाले गए वर्णों की समीक्षा करें और उपयुक्त संरचना जोड़ें।

संबंधित टूल और मार्गदर्शिकाएँ

आगे इनका इस्तेमाल करें: HTML से PDF, PDF में टेक्स्ट पहचानें (OCR), PDF से टेक्स्ट।