نصوص التعرف البصري القديمة تجعل نماذج اللغة تتعلم بكفاءة 30 بالمئة فقط – مشروع FineBooks يهدف إلى تغيير ذلك
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
اختبر مشروع FineBooks من Hugging Face وEleutherAI 14 نموذجًا مفتوحًا للتعرف البصري على أكثر من 2000 صفحة من الكتب التاريخية. وتُظهر النتائج أن النماذج الأصغر غالبًا ما تتفوق على المنافسين الأكبر، حيث حقق النموذج الأفضل دقة تزيد عن 97 بالمئة في الأحرف بتكلفة أقل من دولارين لكل ألف صفحة. ووفقًا للمؤلفين، فإن الجودة كافية لتدريب الذكاء الاصطناعي ولكنها ليست كافية بعد للأغراض الأكاديمية.
مشروع FineBooks من Hugging Face وEleutherAI اختبر 14 نموذجًا مفتوح المصدر للتعرف الضوئي على الحروف (OCR) على 2165 صفحة من الكتب التاريخية، ونشر النتائج في لوحة تصنيف. الدافع وراء ذلك هو أن نصوص التعرف الضوئي من المكتبات غالبًا ما تكون معيبة، ونموذج اللغة الذي يتم تدريبه على هذه النصوص يتعلم بكفاءة تبلغ 30% فقط مقارنة بالنسخ البشرية، كما تم قياسه في مشروع Talkie. النموذج الرائد، dots.mocr، لديه 3 مليارات معامل ويصل إلى دقة 97.6% بتكلفة 1.94 دولار لكل ألف صفحة، بينما يحتل OvisOCR2، الذي لديه 0.9 مليار معامل فقط، المركز الثاني بتكلفة 0.46 دولار لكل ألف صفحة، مما يُظهر أن حجم النموذج وجودة التعرف الضوئي لا يرتبطان تقريبًا بالوثائق التاريخية. التقييم يغطي فقط النصوص اللاتينية Antiqua باللغات الإنجليزية والفرنسية والألمانية واللاتينية، ويقتصر على المستندات الشبيهة بالكتب ذات النص المتدفق في عمود واحد. كخطوة تالية، يخطط الفريق لإعادة معالجة حوالي 200,000 وثيقة من مكتبة التراث biodiversité (BHL) في المجال العام باستخدام أحد النماذج الرائدة ونشر النص كمجموعة بيانات مفتوحة. بينما النماذج جيدة بما يكفي لتدريب الذكاء الاصطناعي، فإنها تستبدل الأحرف القديمة مثل s الطويلة بمكافئات حديثة، وهو ما يمثل مشكلة للنسخ العلمي؛ ووفقًا للمؤلفين، يمكن للضبط الدقيق المستهدف إصلاح ذلك.
المصدر: The Decoder (DE) —
الأصلي
