GSPO: تعلم التعزيز القابل للتوسع لنماذج اللغة
Alibaba/Qwen
تقترح Alibaba Qwen خوارزمية GSPO (Group Sequence Policy Optimization) الجديدة في التعلم التعزيزي التي تعالج عدم الاستقرار في الأساليب الحالية مثل GRPO. تستخدم GSPO التحسين على مستوى التسلسل لتحسين كفاءة التدريب واستقراره والتوافق مع نماذج Mixture-of-Experts، مما يساهم في أداء نماذج Qwen3.
أعلنت شركة Alibaba Qwen عن تقديم Group Sequence Policy Optimization (GSPO)، وهي خوارزمية تعلم تعزيزي مصممة لتوسيع نطاق تدريب نماذج اللغة. على عكس الخوارزميات الحالية مثل GRPO، تحدد GSPO نسبة الأهمية بناءً على احتمالية التسلسل وتقوم بإجراء قص (clipping) ومكافآت وتحسين على مستوى التسلسل. يعالج هذا النهج مشكلات عدم الاستقرار الحادة التي لوحظت في GRPO أثناء التدريب الطويل، بما في ذلك الانهيار غير القابل للعكس للنموذج. تُظهر GSPO كفاءة تدريب أعلى بشكل ملحوظ، محققة أداءً أفضل تحت نفس تكلفة التدريب، وتمكن من تحسينات مستمرة في الأداء مع زيادة القدرة الحاسوبية. كما أنها تعمل بشكل طبيعي على استقرار تدريب نماذج الخبراء المختلطة (MoE) الكبيرة، مما يلغي الحاجة إلى استراتيجية Routing Replay التي تتطلبها GRPO. بالإضافة إلى ذلك، تتميز GSPO بقدرة أكبر على تحمل الفروقات الدقيقة في الدقة، مما يجعلها صديقة للبنية التحتية في سيناريوهات مثل الطرح الجزئي والتعلم التعزيزي متعدد الجولات. تم تطبيق GSPO بنجاح على التدريب التعزيزي واسع النطاق لأحدث نماذج Qwen3، مما أطلق العنان لإمكانيات توسيع نطاق التعزيزي (RL scaling).
المصدر: Alibaba Qwen —
الأصلي
