快手新RL方法SRPO:训练效率比GRPO提升10倍用于大模型训练
快手研究人员推出了SRPO,一种两阶段强化学习方法,能在1/10的训练步骤中达到DeepSeek-R1-Zero级别的数学和代码任务性能。该方法解决了标准GRPO中固有的跨域冲突和低效样本利用问题。
Synced27.07 · 18:04
快手研究人员推出了SRPO,一种两阶段强化学习方法,能在1/10的训练步骤中达到DeepSeek-R1-Zero级别的数学和代码任务性能。该方法解决了标准GRPO中固有的跨域冲突和低效样本利用问题。
来自快手的 KwaiKAT 团队发布了 KAT-Coder-V2.5,这是一个在真实仓库中运行的智能体编码模型。通过使用 AutoBuilder,他们成功创建了涵盖12种语言的超过10万个可验证环境。该模型在 PinchBench 基准测试中以94.9分领先,并在 SWE-Bench Pro 上以65.2分排名第二。开源版本 KAT-Coder-V2.5-Dev 已在 Hugging Face 上提供。
Anthropic