उद्धरणों में टेक्स्ट मान
yes जैसे शब्द, तारीखें, विराम चिह्न और कोलन वाले वाक्यांश स्ट्रिंग मान के रूप में रखें। निकाला गया टेक्स्ट YAML निर्देश या कस्टम ऑब्जेक्ट टैग नहीं बनता।
PDF टेक्स्ट आइटम और उनके पेज स्थानों को YAML डेटा के रूप में निर्यात करें।
फ़ाइलें यहाँ छोड़ें या नीचे का बटन इस्तेमाल करें।
अधिकतम 25 MB कुल · फ़ाइलें आपके डिवाइस पर रहती हैं
दस्तावेज़ का पूर्वावलोकन यहाँ देखें। जोड़ी गई सामग्री के लिए यह स्थिति तय करने का मार्गदर्शन है; सहेजा परिणाम जाँचें।
चुने गए PDF पेजों से निकले टेक्स्ट आइटम वाली YAML फ़ाइल बनाएँ। परिणाम में मूल पेज संदर्भ, पेज की ज्यामिति और टेक्स्ट स्थिति के रूपांतरण होते हैं, जिससे इसे टेक्स्ट एडिटर में जाँचना या अलग प्रोसेसिंग प्रक्रिया में इस्तेमाल करना आसान है।
निर्यात दस्तावेज़ को ऐप कॉन्फ़िगरेशन नहीं मानता। यह शीर्षक स्तरों का अनुमान नहीं लगा सकता, चित्र नहीं निकाल सकता, चालान के फ़ील्ड नहीं पहचान सकता और दिखावट से तालिका फिर नहीं बना सकता। टेक्स्ट PDF रीडर के निष्कर्षण क्रम में होता है, जो पढ़ने के क्रम से अलग हो सकता है।
yes जैसे शब्द, तारीखें, विराम चिह्न और कोलन वाले वाक्यांश स्ट्रिंग मान के रूप में रखें। निकाला गया टेक्स्ट YAML निर्देश या कस्टम ऑब्जेक्ट टैग नहीं बनता।
चुने गए पेज अपनी मूल संख्या रखते हैं। समीक्षक आउटपुट ऐरे के स्थान गिने बिना संबंधित PDF पेज पर लौट सकते हैं।
शब्दों के साथ टेक्स्ट रूपांतरण, दिशा और पेज आयाम रखें। आगे की प्रक्रिया तैयार तालिका मानने के बजाय स्थिति जाँच सकती है।
आउटपुट बताता है कि अर्थ संरचना का पुनर्निर्माण और OCR नहीं किया गया। इससे दूसरा प्रोग्राम परिणाम को निकाले गए प्रमाण की तरह इस्तेमाल कर सकता है।
वह PDF चुनें जिसमें जाँचने वाला टेक्स्ट है।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
मूल पेजों के छोटे समूह से शुरू करें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
आउटपुट सहेजें और उद्धरण वाले टेक्स्ट मान जाँचें।
बड़ा करने के लिए स्क्रीनशॉट चुनें।
स्क्रीनशॉट इन उपकरणों को सुरक्षित नमूना फ़ाइलों के साथ दिखाते हैं। आपकी फ़ाइल का नाम, पृष्ठ संख्या और सेटिंग अलग हो सकती हैं।
जब टीम अलग व्यूअर के बिना संरचित पेज जानकारी चाहती है, तो टेक्स्ट आधारित समीक्षा में YAML सुविधाजनक हो सकता है। निर्यात को दस्तावेज़ डेटा की तरह इस्तेमाल करें और आयात से पहले अपना सत्यापन लागू करें। PDF विवरण के शब्द YAML फ़ाइल में सहेजे होने भर से वह भरोसेमंद कॉन्फ़िगरेशन नहीं बन जाता।
परिचित दस्तावेज़ लेआउट के निष्कर्षण नियम बनाने से पहले टेक्स्ट और पेज संदर्भ जाँचें।
चुने हुए उद्धरण और पेज स्थान जाँचते समय पढ़ने योग्य मध्यवर्ती रिकॉर्ड रखें।
संरचित टेक्स्ट फ़ाइलों पर काम करने वाले टूल से निकाले गए दस्तावेज़ डेटा के बदलावों की तुलना करें।
| सेटिंग | अपेक्षित परिणाम |
|---|---|
| इनपुट फ़ाइल | 25 MiB और 500 मूल पेजों तक की एक PDF। |
| चुने गए पेज | डाले गए क्रम में अधिकतम 200 पेज; दोहराए गए पेज संदर्भ सिर्फ़ एक बार आते हैं। |
| निष्कर्षण की सीमा | हर पेज पर 20,000 आइटम, हर काम में 100,000 आइटम और 20 लाख टेक्स्ट अक्षर। |
| YAML आउटपुट | उद्धरणों वाले स्ट्रिंग मानों के साथ घोषित YAML 1.2; डाउनलोड का अधिकतम आकार 64 MiB। |
किसी फ़ॉर्म में लेबल के पास yes शब्द और शुरुआती शून्यों वाली संख्या छपी हो सकती है। YAML में इन निकाले गए स्ट्रिंग को जाँचें और स्रोत से मिलाएँ। निर्यात टेक्स्ट को उद्धरण वाले मानों के रूप में रखता है, ताकि आपका ऐप तय कर सके कि मान लेबल, पहचानकर्ता, तारीख या कुछ और है।
| स्थिति | क्या जाँचें |
|---|---|
| टेक्स्ट में Unicode एस्केप अनुक्रम हैं | YAML पार्सर उद्धरणों वाले एस्केप से मूल अक्षर वापस पा सकता है। इससे नियंत्रण अक्षर फ़ाइल संरचना भी नहीं बिगाड़ते। |
| आउटपुट सीधे आयात करने योग्य कॉन्फ़िगरेशन नहीं है | यह निष्कर्षण का रिकॉर्ड है। आपके ऐप को जिन फ़ील्ड की ज़रूरत है, उन्हें अलग से मैप और सत्यापित करें। |
| चुनी गई सामग्री बहुत सघन है | पेज रेंज घटाएँ। सघन पेज, पेज सीमा से पहले टेक्स्ट आइटम या अक्षर सीमा तक पहुँच सकता है। |
नहीं। यह PDF पढ़ता है और YAML आउटपुट बनाता है। यह अपलोड किया गया YAML लोड नहीं करता, टैग नहीं चलाता और कॉन्फ़िगरेशन सेटिंग लागू नहीं करता।
अपने आप OCR नहीं होता। पहले सिर्फ़ चित्र वाली PDF पर OCR चलाएँ, फिर निर्यात करने से पहले पहचाने गए टेक्स्ट को जाँचें।
ज़रूरी नहीं। कई कॉलम वाले पेज और निश्चित स्थान पर रखे लेबल अलग निष्कर्षण क्रम दे सकते हैं। उनके निर्देशांक और मूल पेज जाँचें।