ओपन सोर्सशोध 🇺🇸 24.07.2026 09:02

बाईदू के अनलिमिटेड-OCR के साथ हाई-रिज़ॉल्यूशन छवियों और बहु-पृष्ठ PDF के लिए एंड-टू-एंड OCR पाइपलाइन बनाना

BaiduBaidu
यह ट्यूटोरियल दस्तावेज़ छवियों और बहु-पृष्ठ PDF के लिए बाईदू के अनलिमिटेड-OCR मॉडल का उपयोग करके एक पूर्ण OCR वर्कफ़्लो बनाने का प्रदर्शन करता है। इसमें GPU वातावरण सेटअप, मॉडल लोडिंग, गंडम और बेस मोड में एकल-पृष्ठ अनुमान, और PyMuPDF के साथ बहु-पृष्ठ PDF पार्सिंग शामिल है।
यह ट्यूटोरियल Baidu के Unlimited-OCR मॉडल के लिए डॉक्यूमेंट इमेज और मल्टी-पेज PDF पर एक पूर्ण वर्कफ़्लो बनाता है। यह GPU वातावरण कॉन्फ़िगर करता है, निर्भरताएँ इंस्टॉल करता है, और 3B पैरामीटर वाले विज़न-लैंग्वेज मॉडल को ऑटोमैटिक डेटाटाइप चयन के साथ लोड करता है। यह परीक्षण के लिए संरचित नमूना दस्तावेज़ तैयार करता है। वर्कफ़्लो सिंगल-पेज OCR के लिए टाइल्ड गंडम इनफरेंस मोड और फास्टर बेस मोड दोनों का मूल्यांकन करता है, इसके बाद PyMuPDF और infer_multi() के साथ मल्टी-पेज PDF पार्सिंग तक विस्तार करता है। यह घने लेआउट, टेबल, पैराग्राफ़ और क्रॉस-पेज सामग्री को प्रोसेस करने के लिए लॉन्ग-कॉन्टेक्स्ट जनरेशन सेटिंग्स, रिपीटिशन कंट्रोल और स्ट्रक्चर्ड आउटपुट हैंडलिंग को संरक्षित रखता है। अंतिम चीट शीट विभिन्न दस्तावेज़ प्रकारों के लिए अनुशंसित मोड का सारांश प्रस्तुत करती है।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार