SRPO:快手新强化学习方法在LLM训练中效率比GRPO高10倍
快手Kwaipilot团队的研究人员提出了SRPO,这是一个两阶段强化学习框架,仅用十分之一的训练步骤即可在数学和代码领域达到DeepSeek-R1-Zero级别的性能。SRPO通过分阶段训练和历史重采样,解决了跨领域优化冲突、样本效率低和过早饱和的问题。
快手KwaiPilot团队开发了SRPO(两阶段历史重采样策略优化),这是一种用于大型语言模型的强化学习框架,性能超越了标准的GRPO。SRPO采用两阶段训练范式:首先在具有挑战性的数学数据上训练以激发推理能力,然后集成代码数据实现技能组合。历史重采样机制会过滤掉零奖励方差的简单样本,确保梯度更新有效。实验表明,SRPO-Qwen-32B在AIME24上取得50分,在LiveCodeBench上获得41.6分,与DeepSeek-R1-Zero-32B性能相当,但训练步数减少了10倍。该模型展现出重新检查、犹豫和探索等反思行为,并能自发使用代码验证数学解答。团队已开源该模型并发布技术报告。
来源: Synced —
原文
