PDF से XML

PDF टेक्स्ट आइटम और पेज की ज्यामिति को स्पष्ट रूप से बताई गई XML संरचना में निकालें।

PDF फ़ाइलें चुनें

फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।

अधिकतम 25 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं

विषय सूचीअनुभाग: 10

XML निर्यात में क्या होता है?

PDF की चुनी जा सकने वाली टेक्स्ट परत को XML के रूप में निर्यात करें। फ़ाइल टेक्स्ट आइटम को उनके मूल पेज नंबर के तहत समूहित करती है और पेज की ज्यामिति, टेक्स्ट दिशा तथा स्थिति के रूपांतरण दर्ज करती है। इससे जाँच और आगे की प्रक्रिया के लिए संरचित प्रमाण मिलता है।

XML बताता है कि PDF टेक्स्ट रीडर ने क्या निकाला। यह वह मूल XML नहीं है जिससे दस्तावेज़ बनाया गया होगा, और यह चालान फ़ील्ड नहीं पहचानता, तालिका संबंध फिर से नहीं बनाता या चित्र निर्यात नहीं करता। सिर्फ़ चित्र वाले पेजों पर पहले OCR ज़रूरी है।

PDF से XML की सुविधाएँ

पेज के अनुसार एलिमेंट

निकाले गए टेक्स्ट के साथ मूल पेज नंबर, घुमाव और दिखाई देने वाली पेज सीमाएँ रखें। चुनी गई रेंज की समीक्षा के समय यह उपयोगी संदर्भ बनता है।

एस्केप किए गए टेक्स्ट मान

ऐम्परसैंड और कोण वाले कोष्ठक जैसे अक्षर XML एलिमेंट के अंदर डेटा बने रहते हैं। मार्कअप जैसा दिखने वाला टेक्स्ट इस निर्यात से चलने योग्य पेज सामग्री नहीं बन सकता।

वापस प्राप्त किए जा सकने वाले विशेष स्ट्रिंग

जिन अक्षरों को XML सीधे नहीं दिखा सकता, वे स्पष्ट चिह्नित JSON स्ट्रिंग एन्कोडिंग इस्तेमाल करते हैं। यह चिह्न प्राप्त करने वाले प्रोग्राम को उन मानों को ठीक तरह वापस पाने देता है।

ब्राउज़र में प्रोसेसिंग

XML फ़ाइल अपने डिवाइस पर बनाएँ। स्रोत न तो कन्वर्ज़न के लिए अपलोड होता है और न दोबारा लिखा जाता है।

PDF से XML कैसे निकालें?

  1. चुने जा सकने वाले टेक्स्ट वाला अनएन्क्रिप्टेड PDF चुनें।
  2. पेज वाले बॉक्स में ज़रूरी पेज नंबर या रेंज डालें।
  3. फ़ाइल कन्वर्ट करें और XML परिणाम डाउनलोड करें।
  4. XML को टेक्स्ट एडिटर या XML समर्थित ऐप में खोलें।
  5. एलिमेंट को दूसरे सिस्टम में मैप करने से पहले परिचित पेज और वाक्यांश की तुलना करें।

मूल PDF चुनें

पढ़ी जा सकने वाली टेक्स्ट परत वाला PDF चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से XML: मूल PDF का चयन।

पेज रेंज सीमित करें

XML निष्कर्षण के लिए ज़रूरी पेज चुनें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से XML: पेज रेंज और निष्कर्षण सीमाएँ।

XML सहेजें

XML डाउनलोड करें और उसके पेज एलिमेंट देखें।

बड़ा करने के लिए स्क्रीनशॉट चुनें।
PDF से XML: तैयार XML निर्यात का डाउनलोड।

स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।

PDF टेक्स्ट जाँचने के लिए XML क्यों इस्तेमाल करें?

XML आधारित प्रक्रिया को अपने रूपांतरण नियम लगाने से पहले स्पष्ट पेज और आइटम एलिमेंट चाहिए हो सकते हैं। टीम उन एलिमेंट की जाँच कर सकती है, मूल पेज संदर्भ रख सकती है और परिचित दस्तावेज़ प्रकारों के लिए अलग मैपिंग बना सकती है। मैपिंग को निष्कर्षण से अलग रखें: एक टेक्स्ट आइटम का दूसरे के पास होना अपने आप व्यावसायिक संबंध तय नहीं करता।

इस XML आउटपुट पर कौन काम कर सकता है?

इंटीग्रेशन डेवलपर

पेज और आइटम एलिमेंट को नियंत्रित दस्तावेज़ प्रोसेसिंग प्रक्रिया के इनपुट के रूप में इस्तेमाल करें।

दस्तावेज़ अभिलेखपाल

जाँचें कि सुरक्षित मूल PDF के साथ टेक्स्ट भी उपलब्ध बना हुआ है या नहीं।

डेटा ऑडिटर

रूपांतरण नियम स्वीकार करने से पहले आउटपुट के नमूना मानों की तुलना उनके मूल पेजों से करें।

सेटिंग और आउटपुट की जाँच

सेटिंगअपेक्षित परिणाम
स्रोत25 MiB तक की एक PDF, मूल दस्तावेज़ में अधिकतम 500 पेज।
पेज रेंजअधिकतम 200 चुने गए पेज। खाली रेंज में सभी पेज तभी आते हैं जब कुल संख्या इस सीमा के अंदर हो।
टेक्स्ट की सीमाएँहर पेज पर अधिकतम 20,000 आइटम, हर काम में 100,000 आइटम और 20 लाख टेक्स्ट अक्षर।
डाउनलोड फ़ाइल64 MiB तक का XML दस्तावेज़। कोई बाहरी DTD या स्कीमा नहीं लाया जाता।

पेज जाँचने के बाद परिचित लेबल मैप करें

डिलीवरी दस्तावेज़ के लिए एक पेज निर्यात करें और परिचित संदर्भ संख्या ढूँढें। उसके टेक्स्ट रूपांतरण और पास के आइटम की मूल पेज से तुलना करें। इसके बाद आपका ऐप उस दस्तावेज़ प्रकार का नियम लागू कर सकता है। असंबंधित लेआउट में पास की हर संख्या को एक ही फ़ील्ड न मानें।

PDF से XML की समस्याओं का समाधान

स्थितिक्या जाँचें
XML सप्लायर के स्कीमा से मेल नहीं खातानिर्यात अपनी निष्कर्षण संरचना इस्तेमाल करता है। प्राप्त करने वाले सिस्टम को जिस स्कीमा की अपेक्षा है, उसके लिए अलग मैपिंग बनाएँ।
एलिमेंट में encoding एट्रिब्यूट हैअगर encoding का मान json है, तो उसके टेक्स्ट को JSON स्ट्रिंग की तरह पार्स करें ताकि वे अक्षर वापस मिल सकें जो सीधे XML में नहीं आ सकते।
शब्द गायब हैं या क्रम अलग हैस्कैन किए गए पेज या असामान्य टेक्स्ट स्थिति जाँचें। ज़रूरत के अनुसार OCR करें और निर्देशांक देखें।

अक्सर पूछे जाने वाले सवाल

क्या PDF से XML मूल स्रोत XML वापस देता है?

नहीं। PDF में आम तौर पर मूल डेटा मॉडल नहीं रहता। यह निर्यात वह टेक्स्ट परत और ज्यामिति दर्ज करता है जो रीडर निकाल सकता है।

क्या PDF टैग XML दस्तावेज़ मॉडल में बदलते हैं?

नहीं। टूल टैग वाले PDF की अर्थ संरचना, शीर्षक या तालिका संरचना फिर से नहीं बनाता। इसके पेज और आइटम एलिमेंट निष्कर्षण के परिणाम बताते हैं।

क्या इस XML को फिर उसी PDF में बदल सकता हूँ?

XML से PDF टूल XML स्रोत को प्रिंट कर सकता है, लेकिन इस निष्कर्षण फ़ाइल से मूल पेज डिज़ाइन दोबारा नहीं बना सकता। मूल PDF रखें।

संबंधित टूल

XML से PDF, PDF से JSON, PDF में अक्षर पहचान.