智能体开源 🇺🇸 26.07.2026 14:01

KwaiKAT团队推出KAT-Coder-V2.5:基于10万+可验证仓库训练的智能编程模型

AnthropicAnthropic
快手KwaiKAT团队发布了KAT-Coder-V2.5,这是一个在超过10万个可验证环境中训练的编程模型。该模型在PinchBench上以94.9分位居榜首,在SWE-Bench Pro上以65.2分排名第二。开源权重版本KAT-Coder-V2.5-Dev已在Hugging Face上以Apache-2.0许可协议发布。
快手KwaiKAT团队推出了KAT-Coder-V2.5,这是一个基于智能体的编码模型,在超过10万个可验证的代码仓库(涵盖12种编程语言)上进行了训练。该模型采用名为AutoBuilder的流水线来构建可执行环境,成功率达到57.2%。在一次审计发现约16%的强化学习(RL)轨迹因沙箱错误而失败后,训练基础设施问题得到修复,失败率降至2%以下。该模型采用非对称PPO算法,配备了三层奖励系统和多教师知识蒸馏技术。在统一的Claude Code框架下,KAT-Coder-V2.5以94.9分领先PinchBench,击败了Opus 4.8(93.5分);在SWE-Bench Pro上排名第二(65.2分对69.2分),在KAT Code Bench上也位列第二(53.1分对57.3分);但在Terminal-Bench 2.1(60.7分)和SciCode(50.3分)上表现落后。开源的KAT-Coder-V2.5-Dev是一个单独版本,总参数量35B/激活参数3B的混合专家(MoE)模型,基于Qwen3.6-35B-A3B进行后训练,已在Hugging Face上以Apache-2.0许可证发布。
来源: MarkTechPost — 原文
我们之前关于此话题的帖子 ↓
最新新闻