研究模型 🇺🇸 27.07.2026 18:04

快手新RL方法SRPO:训练效率比GRPO提升10倍用于大模型训练

快手研究人员推出了SRPO,一种两阶段强化学习方法,能在1/10的训练步骤中达到DeepSeek-R1-Zero级别的数学和代码任务性能。该方法解决了标准GRPO中固有的跨域冲突和低效样本利用问题。
快手团队Kwaipilot发布了一种新的强化学习训练架构——两阶段历史重新采样策略优化(Two-Staged history-Resampling Policy Optimization,SRPO),解决了标准GRPO的关键问题:数学与代码任务之间的冲突、因组内奖励相同导致的低效率以及过早收敛。SRPO包含两个阶段:第一阶段,模型仅使用复杂数学数据进行训练,以发展长链推理能力;第二阶段,加入编程任务以巩固技能。为提升效率,采用了历史重新采样(History Resampling),即重新构建数据集,剔除所有答案都正确的过于简单的示例。最终,基于Qwen2.5-32B的SRPO-Qwen-32B模型在AIME24(50分)和LiveCodeBench(41.6分)基准测试中取得了与DeepSeek-R1-Zero-32B相当的成绩,但仅需其十分之一的训练步数。实验中,模型还自发学会了使用程序代码来验证数学解决方案。
来源: Synced — 原文
我们之前关于此话题的帖子 ↓
最新新闻