नए मॉडल, वही लाभ: पुर्तगाली में DharmaOCR विशेषज्ञता नई आर्किटेक्चर को पीछे छोड़ती है
Mistral
DharmaOCR ऑप्टिकल कैरेक्टर रिकॉग्निशन मॉडल, जो ब्राज़ीलियाई पुर्तगाली के लिए डिज़ाइन किया गया है, पुर्तगाली बेंचमार्क में Mistral OCR4 और Unlimited-OCR जैसे नए मॉडलों से बेहतर प्रदर्शन करता है। यह लाभ लक्षित प्रशिक्षण और एक ही भाषा में विशेषज्ञता के माध्यम से प्राप्त हुआ है।
ब्राज़ीलियाई पुर्तगाली के लिए DharmaOCR ऑप्टिकल कैरेक्टर रिकॉग्निशन मॉडल बनाने वाले शोधकर्ताओं ने इसकी तुलना नए Mistral OCR4 और Unlimited-OCR मॉडलों से की। हालांकि ये दोनों बाद के मॉडल तकनीकी रूप से अधिक उन्नत आर्किटेक्चर, नए प्रशिक्षण तरीकों और डेटासेट का प्रतिनिधित्व करते हैं, DharmaOCR ने विशेष रूप से पुर्तगाली पर केंद्रित बेंचमार्क में 0.925 स्कोर प्राप्त किया, जबकि Mistral OCR4 का 0.798 और Unlimited-OCR का 0.7587 रहा। यह लाभ विशेषज्ञता के कारण है: DharmaOCR को केवल ब्राज़ीलियाई पुर्तगाली पर प्रशिक्षित किया गया, जिसने अपने सभी संसाधनों को इस भाषा क्षेत्र पर केंद्रित किया, जबकि नए मॉडल बहुभाषी हैं और अपनी क्षमताओं को कई भाषाओं में वितरित करते हैं। इसके अतिरिक्त, DharmaOCR की प्रशिक्षण पाइपलाइन में डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) चरण ने टेक्स्ट डिजनरेशन को कम किया, जहाँ मॉडल धुंधली छवियों पर असंगत दोहराव वाला आउटपुट उत्पन्न करने लगता है। बहुभाषी मॉडल अक्सर विशेष रूप से पुर्तगाली शब्दावली और उचित संज्ञाओं पर विशिष्ट त्रुटियाँ करते हैं; उदाहरण के लिए, Mistral OCR4 ने प्रसिद्ध ब्राज़ीलियाई संगीतकार चिको बुआर्की (Chico Buarque) के नाम को 'Chico Barque' में बदल दिया, और Unlimited-OCR ने 'chico bique' में। लेखकों के अनुसार, विशेषज्ञता एक संरचनात्मक लाभ है जो नए आर्किटेक्चर के आगमन के साथ तब तक गायब नहीं होगा जब तक प्रशिक्षण संसाधन सीमित हैं।
स्रोत: Hugging Face blog —
मूल
