ओपन सोर्सशोध 🇩🇪 10.08.2026 21:02

पुराने OCR टेक्स्ट से भाषा मॉडल केवल 30 प्रतिशत दक्षता पर सीखते हैं – FineBooks प्रोजेक्ट का लक्ष्य इसे बदलना है

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
Hugging Face और EleutherAI का FineBooks प्रोजेक्ट 14 ओपन OCR मॉडलों का परीक्षण 2,000 से अधिक ऐतिहासिक पुस्तक पृष्ठों पर करता है। परिणाम दिखाते हैं कि छोटे मॉडल अक्सर बड़े प्रतिस्पर्धियों से बेहतर प्रदर्शन करते हैं, शीर्ष मॉडल प्रति हजार पृष्ठों पर 2 डॉलर से कम लागत पर 97 प्रतिशत से अधिक वर्ण सटीकता प्राप्त करता है। लेखकों के अनुसार, गुणवत्ता एआई प्रशिक्षण के लिए पर्याप्त है लेकिन अभी तक शैक्षणिक उद्देश्यों के लिए नहीं।
हगिंग फेस और एलिउथरAI की फाइनबुक्स परियोजना ने 2,165 ऐतिहासिक पुस्तक पृष्ठों पर 14 ओपन-सोर्स OCR मॉडलों का परीक्षण किया, और परिणामों को एक लीडरबोर्ड के रूप में प्रकाशित किया। प्रेरणा यह है कि पुस्तकालयों से OCR पाठ अक्सर त्रुटिपूर्ण होते हैं, और ऐसे पाठों पर प्रशिक्षित एक भाषा मॉडल, मानव प्रतिलेखों की तुलना में केवल 30% दक्षता पर सीखता है, जैसा कि टॉकी परियोजना द्वारा मापा गया है। अग्रणी मॉडल, dots.mocr, में 3 बिलियन पैरामीटर हैं और यह $1.94 प्रति हजार पृष्ठों पर 97.6% सटीकता प्राप्त करता है, जबकि OvisOCR2, केवल 0.9 बिलियन पैरामीटर के साथ, $0.46 प्रति हजार पृष्ठों पर दूसरे स्थान पर है, जो दर्शाता है कि ऐतिहासिक दस्तावेजों के लिए मॉडल का आकार और OCR गुणवत्ता शायद ही सहसंबद्ध हैं। मूल्यांकन केवल अंग्रेजी, फ्रेंच, जर्मन और लैटिन में एंटिका लिपियों को कवर करता है, और केवल एकल-स्तंभ प्रवाहित पाठ वाली पुस्तक-समान दस्तावेजों तक सीमित है। अगले कदम के रूप में, टीम लगभग 200,000 सार्वजनिक-डोमेन BHL दस्तावेजों को अग्रणी मॉडलों में से एक के साथ पुनः संसाधित करने और पाठ को एक खुले डेटासेट के रूप में प्रकाशित करने की योजना बना रही है। हालांकि मॉडल AI प्रशिक्षण के लिए पर्याप्त अच्छे हैं, वे लंबे s जैसे पुरातन वर्णों को आधुनिक समकक्षों से बदल देते हैं, जो विद्वानों के प्रतिलेखन के लिए एक समस्या है; लेखकों के अनुसार, लक्षित फाइन-ट्यूनिंग इसे ठीक कर सकती है।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार