smevals: أداة جديدة لتقييم النماذج والاستدلالات والأدوات المساعدة
OpenAI
Anthropic
قدم سايمون ويليسون smevals، وهو إطار عمل جديد لتشغيل مجموعات صغيرة من اختبارات التقييم (التقييمات) لتكوينات مختلفة من النماذج وتقييم النتائج. تتضمن الأداة أوامر للتشغيل والتقييم وعرض النتائج، كما تدعم إنشاء تقارير HTML ثابتة.
سايمون ويليسون، بالتعاون مع مختبر Prime Radiant للذكاء الاصطناعي التطبيقي التابع لجيسي فينسنت، طوّر أداة smevals، وهي أداة جديدة لتشغيل مجموعات صغيرة من اختبارات التقييم (evals) لمختلف تكوينات النماذج وتقييم النتائج. تتيح الأداة للمستخدمين إنشاء مجموعات تقييم على شكل مجلدات تحتوي على ملفات YAML، وتشغيلها ضد نماذج مثل gpt-5.5 وclaude-opus-4.6، ثم تقييم النتائج باستخدام فحوصات محددة. ولتحليل النتائج، تم توفير خادم ويب محلي وأمر لبناء تقرير HTML ثابت. أشار ويليسون إلى أن هذه هي تكرارته الثالثة لمنهجه في التقييمات، ويخطط لتوسيع الأداة في المستقبل.
المصدر: Simon Willison —
الأصلي
