الأبحاثالنماذج 🇺🇸 27.07.2026 18:04

SRPO: طريقة التعلم التعزيزي الجديدة من كويشو أكثر كفاءة بعشر مرات من GRPO لتدريب نماذج اللغة الكبيرة

قدم باحثون من فريق Kwaipilot في كويشو إطار عمل SRPO، وهو إطار تعلم تعزيزي على مرحلتين يحقق أداءً بمستوى DeepSeek-R1-Zero في مجالي الرياضيات والبرمجة باستخدام عُشر خطوات التدريب فقط. يعالج SRPO تعارضات التحسين عبر المجالات، وانخفاض كفاءة العينات، والتشبع المبكر من خلال التدريب المرحلي وإعادة أخذ العينات التاريخية.
طور فريق Kwaipilot في Kuaishou إطار عمل SRPO (تحسين السياسة بإعادة أخذ العينات على مرحلتين)، وهو إطار تعلم تعزيزي للنماذج اللغوية الكبيرة يتفوق على GRPO القياسي. يستخدم SRPO نموذج تدريب على مرحلتين: أولًا، التدريب على بيانات رياضية صعبة لتحفيز الاستدلال، ثم دمج بيانات البرمجة لمزج المهارات. تعمل إعادة أخذ العينات التاريخية على تصفية العينات السهلة ذات تباين المكافأة الصفري، مما يضمن تحديثات فعالة للتدرج. تُظهر التجارب أن نموذج SRPO-Qwen-32B يحقق نتائج 50 في اختبار AIME24 و41.6 في LiveCodeBench، وهو ما يُقارن بنموذج DeepSeek-R1-Zero-32B لكن مع عدد خطوات تدريب أقل بمقدار عشرة أضعاف. يُظهر النموذج سلوكيات تأملية مثل إعادة التحقق والتردد والاستكشاف، ويستخدم البرمجة تلقائيًا للتحقق من الحلول الرياضية. أتاح الفريق النموذج مفتوح المصدر ونشر تقريرًا تقنيًا.
المصدر: Synced — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة