शोधमॉडल 🇨🇳 27.07.2026 17:05

GSPO: भाषा मॉडलों के लिए स्केलेबल रीइन्फोर्समेंट लर्निंग

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen ने Group Sequence Policy Optimization (GSPO) प्रस्तावित किया है, जो एक नया RL एल्गोरिदम है जो GRPO जैसे मौजूदा तरीकों में अस्थिरता को संबोधित करता है। GSPO अनुक्रम-स्तरीय ऑप्टिमाइजेशन का उपयोग करके प्रशिक्षण दक्षता, स्थिरता और Mixture-of-Experts मॉडलों के साथ संगतता में सुधार करता है, जो Qwen3 मॉडलों के प्रदर्शन में योगदान देता है।
अलीबाबा क्यूवेन ने ग्रुप सीक्वेंस पॉलिसी ऑप्टिमाइज़ेशन (GSPO) पेश किया, जो भाषा मॉडल प्रशिक्षण को बड़े पैमाने पर करने के लिए डिज़ाइन किया गया एक सुदृढीकरण अधिगम एल्गोरिदम है। GSPO, GRPO जैसे मौजूदा एल्गोरिदम के विपरीत, सीक्वेंस लाइकलीहुड के आधार पर इम्पॉर्टेंस रेशियो को परिभाषित करता है और सीक्वेंस-स्तरीय क्लिपिंग, रिवॉर्डिंग और ऑप्टिमाइज़ेशन करता है। यह दृष्टिकोण लंबे प्रशिक्षण के दौरान GRPO में देखी गई गंभीर अस्थिरता समस्याओं, जिसमें अपरिवर्तनीय मॉडल पतन भी शामिल है, को हल करता है। GSPO काफी उच्च प्रशिक्षण दक्षता प्रदर्शित करता है, समान प्रशिक्षण लागत पर बेहतर प्रदर्शन प्राप्त करता है, और बढ़े हुए कंप्यूट के साथ निरंतर प्रदर्शन सुधार को सक्षम बनाता है। यह बड़े मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडलों के प्रशिक्षण को भी स्वाभाविक रूप से स्थिर करता है, GRPO द्वारा आवश्यक रूटिंग रीप्ले रणनीति की आवश्यकता को समाप्त करता है। इसके अतिरिक्त, GSPO परिशुद्धता विसंगतियों के प्रति अधिक सहिष्णु है, जो इसे आंशिक रोलआउट और मल्टी-टर्न आरएल जैसे परिदृश्यों के लिए बुनियादी ढांचे के अनुकूल बनाता है। GSPO को नवीनतम Qwen3 मॉडलों के बड़े पैमाने पर आरएल प्रशिक्षण में सफलतापूर्वक लागू किया गया है, जिससे आरएल स्केलिंग की क्षमता और अधिक उजागर हुई है।
स्रोत: Alibaba Qwen — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार