الأبحاث 🇺🇸 27.07.2026 09:06

نتائج تقييم كل نموذج متاحة الآن على صفحات Hugging Face

Hugging FaceHugging Face MetaMeta
مشروع "تقويم كل تقويم" (EEE) الذي أطلقه ائتلاف EvalEval يعمل على توحيد تقارير تقييم الذكاء الاصطناعي باستخدام مخطط JSON موحد. وهو الآن مدمج مع تقييمات مجتمع Hugging Face، مما يتيح الربط المتبادل بين صفحات النماذج وسجلات التقييم الكاملة، مع جمع أكثر من 229,000 نتيجة من 31 صيغة بالفعل.
مشروع EEE (التقييم الشامل لكل نموذج)، الذي أُطلق في فبراير 2026 من قبل تحالف EvalEval، يهدف إلى توحيد الإبلاغ عن تقييمات الذكاء الاصطناعي عبر المُقيّمين الأساسيين والجهات الخارجية. يستخدم مخطط JSON موحدًا يسجل من قام بالتقييم، وأي نموذج، وكيفية الوصول إليه، وإعدادات التوليد، وتعريفات المقاييس، ونتائج العينات الاختيارية. أطلقت Hugging Face في الوقت نفسه مبادرة التقييمات المجتمعية (Community Evals) لامركزية الإبلاغ عن نتائج المعايير على المنصة. وقد تم الآن دمج الاثنين: يمكن للمساهمين إرسال نتائج EEE إلى تقييمات Hugging Face المجتمعية عبر محول يحول سجلات JSON إلى تنسيق YAML الذي تتوقعه Hugging Face. تظهر النتائج الناتجة على صفحات النموذج مع شارة ترتبط بسجل EEE الكامل، بما في ذلك إعدادات التوليد، وإصدار الإطار، وملاحظات إعادة الإنتاج. نما مخزن بيانات EEE على Hugging Face إلى حوالي 229,000 نتيجة تقييم عبر أكثر من 22,000 نموذج و2,200 معيار، مستمدة من 31 تنسيق إبلاغ مختلف. إعادة إنتاج هذه العمليات من الصفر ستكلف مئات الآلاف من الدولارات، مما يبرز قيمة الإبلاغ المركزي. يدعم المحول حاليًا أربعة معايير رسمية: MMLU-Pro، وGPQA، وHLE، وGSM8K. يمكن للمستخدمين إرسال سجلات EEE إلى مخزن البيانات، ثم تشغيل المحول لتوليد معاينات YAML وفتح طلبات السحب بعد المراجعة.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة