SRPO: طريقة تعلم تعزيزي جديدة من كويشو أكثر كفاءة بعشر مرات من GRPO لتدريب نماذج اللغة الكبيرة
قدم باحثون من كويشو طريقة SRPO، وهي طريقة تعلم تعزيزي من مرحلتين تحقق أداءً على مستوى DeepSeek-R1-Zero في مهام الرياضيات والبرمجة في 1/10 من خطوات التدريب. تعالج الطريقة مشكلات تعارض المجالات وضعف استخدام العينات المتأصلة في GRPO القياسي.
Synced27.07 · 18:04

