पेज के अनुसार एलिमेंट
निकाले गए टेक्स्ट के साथ मूल पेज नंबर, घुमाव और दिखाई देने वाली पेज सीमाएँ रखें। चुनी गई रेंज की समीक्षा के समय यह उपयोगी संदर्भ बनता है।
PDF टेक्स्ट आइटम और पेज की ज्यामिति को स्पष्ट रूप से बताई गई XML संरचना में निकालें।
फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।
अधिकतम 25 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं
दस्तावेज़ का पूर्वावलोकन यहाँ देखें। जोड़ी गई सामग्री के लिए यह स्थिति तय करने का मार्गदर्शन है; सहेजा परिणाम जाँचें।
PDF की चुनी जा सकने वाली टेक्स्ट परत को XML के रूप में निर्यात करें। फ़ाइल टेक्स्ट आइटम को उनके मूल पेज नंबर के तहत समूहित करती है और पेज की ज्यामिति, टेक्स्ट दिशा तथा स्थिति के रूपांतरण दर्ज करती है। इससे जाँच और आगे की प्रक्रिया के लिए संरचित प्रमाण मिलता है।
XML बताता है कि PDF टेक्स्ट रीडर ने क्या निकाला। यह वह मूल XML नहीं है जिससे दस्तावेज़ बनाया गया होगा, और यह चालान फ़ील्ड नहीं पहचानता, तालिका संबंध फिर से नहीं बनाता या चित्र निर्यात नहीं करता। सिर्फ़ चित्र वाले पेजों पर पहले OCR ज़रूरी है।
निकाले गए टेक्स्ट के साथ मूल पेज नंबर, घुमाव और दिखाई देने वाली पेज सीमाएँ रखें। चुनी गई रेंज की समीक्षा के समय यह उपयोगी संदर्भ बनता है।
ऐम्परसैंड और कोण वाले कोष्ठक जैसे अक्षर XML एलिमेंट के अंदर डेटा बने रहते हैं। मार्कअप जैसा दिखने वाला टेक्स्ट इस निर्यात से चलने योग्य पेज सामग्री नहीं बन सकता।
जिन अक्षरों को XML सीधे नहीं दिखा सकता, वे स्पष्ट चिह्नित JSON स्ट्रिंग एन्कोडिंग इस्तेमाल करते हैं। यह चिह्न प्राप्त करने वाले प्रोग्राम को उन मानों को ठीक तरह वापस पाने देता है।
XML फ़ाइल अपने डिवाइस पर बनाएँ। स्रोत न तो कन्वर्ज़न के लिए अपलोड होता है और न दोबारा लिखा जाता है।
पढ़ी जा सकने वाली टेक्स्ट परत वाला PDF चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
XML निष्कर्षण के लिए ज़रूरी पेज चुनें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
XML डाउनलोड करें और उसके पेज एलिमेंट देखें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।
XML आधारित प्रक्रिया को अपने रूपांतरण नियम लगाने से पहले स्पष्ट पेज और आइटम एलिमेंट चाहिए हो सकते हैं। टीम उन एलिमेंट की जाँच कर सकती है, मूल पेज संदर्भ रख सकती है और परिचित दस्तावेज़ प्रकारों के लिए अलग मैपिंग बना सकती है। मैपिंग को निष्कर्षण से अलग रखें: एक टेक्स्ट आइटम का दूसरे के पास होना अपने आप व्यावसायिक संबंध तय नहीं करता।
पेज और आइटम एलिमेंट को नियंत्रित दस्तावेज़ प्रोसेसिंग प्रक्रिया के इनपुट के रूप में इस्तेमाल करें।
जाँचें कि सुरक्षित मूल PDF के साथ टेक्स्ट भी उपलब्ध बना हुआ है या नहीं।
रूपांतरण नियम स्वीकार करने से पहले आउटपुट के नमूना मानों की तुलना उनके मूल पेजों से करें।
| सेटिंग | अपेक्षित परिणाम |
|---|---|
| स्रोत | 25 MiB तक की एक PDF, मूल दस्तावेज़ में अधिकतम 500 पेज। |
| पेज रेंज | अधिकतम 200 चुने गए पेज। खाली रेंज में सभी पेज तभी आते हैं जब कुल संख्या इस सीमा के अंदर हो। |
| टेक्स्ट की सीमाएँ | हर पेज पर अधिकतम 20,000 आइटम, हर काम में 100,000 आइटम और 20 लाख टेक्स्ट अक्षर। |
| डाउनलोड फ़ाइल | 64 MiB तक का XML दस्तावेज़। कोई बाहरी DTD या स्कीमा नहीं लाया जाता। |
डिलीवरी दस्तावेज़ के लिए एक पेज निर्यात करें और परिचित संदर्भ संख्या ढूँढें। उसके टेक्स्ट रूपांतरण और पास के आइटम की मूल पेज से तुलना करें। इसके बाद आपका ऐप उस दस्तावेज़ प्रकार का नियम लागू कर सकता है। असंबंधित लेआउट में पास की हर संख्या को एक ही फ़ील्ड न मानें।
| स्थिति | क्या जाँचें |
|---|---|
| XML सप्लायर के स्कीमा से मेल नहीं खाता | निर्यात अपनी निष्कर्षण संरचना इस्तेमाल करता है। प्राप्त करने वाले सिस्टम को जिस स्कीमा की अपेक्षा है, उसके लिए अलग मैपिंग बनाएँ। |
| एलिमेंट में encoding एट्रिब्यूट है | अगर encoding का मान json है, तो उसके टेक्स्ट को JSON स्ट्रिंग की तरह पार्स करें ताकि वे अक्षर वापस मिल सकें जो सीधे XML में नहीं आ सकते। |
| शब्द गायब हैं या क्रम अलग है | स्कैन किए गए पेज या असामान्य टेक्स्ट स्थिति जाँचें। ज़रूरत के अनुसार OCR करें और निर्देशांक देखें। |
नहीं। PDF में आम तौर पर मूल डेटा मॉडल नहीं रहता। यह निर्यात वह टेक्स्ट परत और ज्यामिति दर्ज करता है जो रीडर निकाल सकता है।
नहीं। टूल टैग वाले PDF की अर्थ संरचना, शीर्षक या तालिका संरचना फिर से नहीं बनाता। इसके पेज और आइटम एलिमेंट निष्कर्षण के परिणाम बताते हैं।
XML से PDF टूल XML स्रोत को प्रिंट कर सकता है, लेकिन इस निष्कर्षण फ़ाइल से मूल पेज डिज़ाइन दोबारा नहीं बना सकता। मूल PDF रखें।