पुराने OCR टेक्स्ट से भाषा मॉडल केवल 30 प्रतिशत दक्षता पर सीखते हैं – FineBooks प्रोजेक्ट का लक्ष्य इसे बदलना है
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
Hugging Face और EleutherAI का FineBooks प्रोजेक्ट 14 ओपन OCR मॉडलों का परीक्षण 2,000 से अधिक ऐतिहासिक पुस्तक पृष्ठों पर करता है। परिणाम दिखाते हैं कि छोटे मॉडल अक्सर बड़े प्रतिस्पर्धियों से बेहतर प्रदर्शन करते हैं, शीर्ष मॉडल प्रति हजार पृष्ठों पर 2 डॉलर से कम लागत पर 97 प्रतिशत से अधिक वर्ण सटीकता प्राप्त करता है। लेखकों के अनुसार, गुणवत्ता एआई प्रशिक्षण के लिए पर्याप्त है लेकिन अभी तक शैक्षणिक उद्देश्यों के लिए नहीं।
हगिंग फेस और एलिउथरAI की फाइनबुक्स परियोजना ने 2,165 ऐतिहासिक पुस्तक पृष्ठों पर 14 ओपन-सोर्स OCR मॉडलों का परीक्षण किया, और परिणामों को एक लीडरबोर्ड के रूप में प्रकाशित किया। प्रेरणा यह है कि पुस्तकालयों से OCR पाठ अक्सर त्रुटिपूर्ण होते हैं, और ऐसे पाठों पर प्रशिक्षित एक भाषा मॉडल, मानव प्रतिलेखों की तुलना में केवल 30% दक्षता पर सीखता है, जैसा कि टॉकी परियोजना द्वारा मापा गया है। अग्रणी मॉडल, dots.mocr, में 3 बिलियन पैरामीटर हैं और यह $1.94 प्रति हजार पृष्ठों पर 97.6% सटीकता प्राप्त करता है, जबकि OvisOCR2, केवल 0.9 बिलियन पैरामीटर के साथ, $0.46 प्रति हजार पृष्ठों पर दूसरे स्थान पर है, जो दर्शाता है कि ऐतिहासिक दस्तावेजों के लिए मॉडल का आकार और OCR गुणवत्ता शायद ही सहसंबद्ध हैं। मूल्यांकन केवल अंग्रेजी, फ्रेंच, जर्मन और लैटिन में एंटिका लिपियों को कवर करता है, और केवल एकल-स्तंभ प्रवाहित पाठ वाली पुस्तक-समान दस्तावेजों तक सीमित है। अगले कदम के रूप में, टीम लगभग 200,000 सार्वजनिक-डोमेन BHL दस्तावेजों को अग्रणी मॉडलों में से एक के साथ पुनः संसाधित करने और पाठ को एक खुले डेटासेट के रूप में प्रकाशित करने की योजना बना रही है। हालांकि मॉडल AI प्रशिक्षण के लिए पर्याप्त अच्छे हैं, वे लंबे s जैसे पुरातन वर्णों को आधुनिक समकक्षों से बदल देते हैं, जो विद्वानों के प्रतिलेखन के लिए एक समस्या है; लेखकों के अनुसार, लक्षित फाइन-ट्यूनिंग इसे ठीक कर सकती है।
स्रोत: The Decoder (DE) —
मूल
