SRPO: Kuaishou का नया RL तरीका LLM प्रशिक्षण के लिए GRPO से 10x अधिक कुशल
Kuaishou के Kwaipilot टीम के शोधकर्ताओं ने SRPO पेश किया है, जो एक दो-चरणीय सुदृढीकरण सीखने का ढांचा है जो गणित और कोड क्षेत्रों में DeepSeek-R1-Zero स्तर का प्रदर्शन प्राप्त करता है, जिसमें प्रशिक्षण चरणों का केवल दसवां हिस्सा लगता है। SRPO चरणबद्ध प्रशिक्षण और इतिहास पुनर्नमूना के माध्यम से क्रॉस-डोमेन ऑप्टिमाइजेशन विरोधाभासों, कम नमूना दक्षता और समय से पहले संतृप्ति को संबोधित करता है।
क्वाईशो के क्वाईपायलट टीम ने SRPO (टू-स्टेज्ड हिस्ट्री-रीसैंपलिंग पॉलिसी ऑप्टिमाइज़ेशन) विकसित किया, जो LLM के लिए एक रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है और मानक GRPO से बेहतर प्रदर्शन करता है। SRPO दो-चरणीय प्रशिक्षण प्रतिमान का उपयोग करता है: पहले, तर्क क्षमता प्राप्त करने के लिए चुनौतीपूर्ण गणित डेटा पर प्रशिक्षण, फिर कौशल संयोजन के लिए कोड डेटा को एकीकृत करना। हिस्ट्री रीसैंपलिंग शून्य रिवॉर्ड वेरियंस वाले आसान नमूनों को फ़िल्टर करता है, जिससे प्रभावी ग्रेडिएंट अपडेट सुनिश्चित होते हैं। प्रयोगों से पता चलता है कि SRPO-Qwen-32B AIME24 पर 50 और LiveCodeBench पर 41.6 का स्कोर प्राप्त करता है, जो DeepSeek-R1-Zero-32B के बराबर है, लेकिन 10 गुना कम प्रशिक्षण चरणों में। मॉडल पुनर्जांच, हिचकिचाहट और अन्वेषण जैसे चिंतनशील व्यवहार प्रदर्शित करता है, और गणित के समाधान को सत्यापित करने के लिए स्वतः कोड का उपयोग करता है। टीम ने मॉडल को ओपन-सोर्स किया और एक तकनीकी रिपोर्ट प्रकाशित की।
स्रोत: Synced —
मूल
