علي بابا كيوين تطلق ProcessBench ونماذج مكافأة عملية محسنة للتفكير الرياضي
Alibaba/Qwen
OpenAI
فريق كيوين التابع لعلي بابا أتاح للجمهور ProcessBench، وهو معيار لاكتشاف الأخطاء في خطوات التفكير الرياضي، كما أطلق نموذجين جديدين لمكافأة العمليات يعتمدان على Qwen2.5-Math. النماذج تتفوق على النماذج مفتوحة المصدر الحالية وتظهر قدرات قوية في تحديد الأخطاء.
أعلن فريق Qwen من شركة Alibaba عن إطلاق ProcessBench، وهو معيار يتضمن 3400 حالة اختبار تركز على مسائل الرياضيات على مستوى المنافسات والأولمبياد، حيث يقوم خبراء بشريون بتحديد أول خطوة خاطئة في الحلول التدريجية. كما أصدر الفريق نموذجين جديدين لمكافأة العملية (PRMs)، هما Qwen2.5-Math-PRM-7B وQwen2.5-Math-PRM-72B، تم ضبطهما بدقة من نماذج Qwen2.5-Math-Instruct. في تقييم Best-of-N (N=8) عبر سبعة معايير رياضية، تفوق Qwen2.5-Math-PRM-7B على التصويت بالأغلبية بمتوسط 1.4%، وساوى أو تجاوز نماذج PRM الأخرى ذات الحجم المماثل. على ProcessBench، تفوق Qwen2.5-Math-PRM-7B على GPT-4o-0806 وجميع النماذج مفتوحة المصدر، متخلفًا فقط عن o1-mini. كما أشار الفريق إلى أن نموذج مكافأة النتيجة Qwen2.5-Math-RM-72B أظهر قدرة مفاجئة على اكتشاف أخطاء الخطوات، متجاوزًا بعض نماذج PRM. يهدف العمل إلى تحسين الإشراف على العملية في استدلال نماذج اللغة الكبيرة.
المصدر: Alibaba Qwen —
الأصلي
