KwaiKAT Team Launches KAT-Coder-V2.5: An Agentic Model for Programming Trained on Over 100,000 Verifiable Repositories
Anthropic
The KwaiKAT team from Kuaishou has released KAT-Coder-V2.5, an agentic coding model trained to operate in real-world repositories. Using AutoBuilder, they successfully created over 100,000 verifiable environments across 12 languages. The model leads the PinchBench benchmark with a score of 94.9 and ranks second on SWE-Bench Pro (65.2). An open version, KAT-Coder-V2.5-Dev, is available on Hugging Face.
Kuaishou의 KwaiKAT 팀이 KAT-Coder-V2.5(Agile Coding Tool Coder) 모델을 공개했습니다. 이는 일회성 코드를 생성하는 대신 실제 실행 가능한 리포지토리 내에서 작업하도록 학습된 에이전트 프로그래밍 모델입니다. 이 모델은 StreamLake를 통해 제공되며, 오픈 버전인 KAT-Coder-V2.5-Dev는 Hugging Face에 Apache-2.0 라이선스로 출시되었습니다. 연구진은 작업을 위한 검증 가능한 환경을 자동으로 구축하는 시스템인 AutoBuilder를 개발했습니다. 작업은 세 가지 요소(작업 설명, 실행 가능한 리포지토리 환경, 검증 테스트 세트)로 설명됩니다. 수정은 모든 테스트를 통과해야만 올바른 것으로 간주됩니다. 작업은 실제 풀 리퀘스트와 커밋에서 추출되며, 원시 이슈 텍스트는 폐기되고 대신 구조화된 설명이 생성됩니다. AutoBuilder는 리포지토리를 분석하고 구성 스크립트를 작성하는 빌드 에이전트와 격리된 샌드박스에서 스크립트를 실행하는 검증 에이전트로 구성됩니다. 환경은 예상 테스트의 90% 이상이 수집되고 통과/실패 결과가 재현될 때 승인됩니다. 사전 구성된 기본 환경, 빌드 템플릿, 레시피 라이브러리를 결합하여 빌드 성공률이 16.5%에서 57.2%로 향상되었으며, 12개 언어로 10만 개 이상의 검증 가능한 환경이 생성되었습니다. 학습 궤적 필터링에는 세 가지 메커니즘(거의 성공한 궤적에 대한 프롬프트, 성공 궤적에 대한 교정 검사, 과적합 방지를 위한 도구 무작위화)이 사용됩니다. 감사 결과 샌드박스 인프라 문제가 발견되었습니다. 강화 학습 궤적의 약 16%가 모델 정책 오류가 아닌 샌드박스 오류로 인해 실패했습니다. 수정(디스크 사용 최적화, 환경 변수 조정, 표준 채팅 엔드포인트 우회) 후 오류율이 2% 미만으로 감소했습니다. 학습에는 비대칭 PPO(Proximal Policy Optimization)가 사용되었으며, 세 가지 보상 수준(테스트 점수 기반 기본 점수, 행동 위반 패널티, 실패 궤적 인센티브)이 적용되었습니다. 5명의 전문가가 역방향 KL(Kullback-Leibler) 발산을 사용한 Multi-Teacher On-Policy Distillation을 통해 결합되었습니다. PinchBench 벤치마크에서 KAT-Coder-V2.5는 94.9점을 기록하며 Opus 4.8(93.5점)을 앞질렀습니다. SWE-Bench Pro에서는 65.2점으로 2위를 기록했습니다(Opus 4.8: 69.2점). Terminal-Bench 2.1에서는 60.7점(최하위), SciCode에서는 50.3점으로 GLM-5.2와 동률을 기록했습니다. 오픈 버전인 KAT-Coder-V2.5-Dev는 별도의 MoE(Mixture of Experts) 모델(전체 35B / 활성 3B)로, Qwen3.6-35B-A3B에 127K SFT(Supervised Fine-Tuning) 예제와 강화 학습을 통해 추가 학습되었으며, 그 결과는 주요 표와 비교할 수 없습니다.
출처: MarkTechPost —
원문
