SRPO:Kuaishouの新しいRL手法は、LLMトレーニングにおいてGRPOよりも10倍効率的
KuaishouのKwaipilotチームの研究者は、SRPOという二段階の強化学習フレームワークを導入しました。このフレームワークは、訓練ステップ数が10分の1でありながら、数学とコードの領域でDeepSeek-R1-Zeroレベルのパフォーマンスを達成します。SRPOは、段階的訓練と履歴のリサンプリングを通じて、クロスドメインの最適化競合、低いサンプル効率、および早期飽和に対処します。
KuaishouのKwaipilotチームは、標準のGRPOを上回るLLM向け強化学習フレームワークであるSRPO(Two-Staged history-Resampling Policy Optimization、2段階履歴リサンプリング方策最適化)を開発した。SRPOは2段階の学習パラダイムを採用しており、最初に困難な数学データで推論を誘発するよう訓練し、その後コードデータを統合してスキルを組み合わせる。History Resampling(履歴リサンプリング)は、報酬の分散がゼロの簡単なサンプルを除去し、効果的な勾配更新を保証する。実験の結果、SRPO-Qwen-32BはAIME24で50点、LiveCodeBenchで41.6点を達成し、DeepSeek-R1-Zero-32Bに匹敵するものの、訓練ステップ数は10分の1であった。このモデルは、再確認やためらい、探索などの内省的な挙動を示し、数学の解答を検証するために自発的にコードを使用する。チームはモデルをオープンソース化し、テクニカルレポートを公開した。
出典: Synced —
原文
