KwaiKAT Team Launches KAT-Coder-V2.5: An Agentic Model for Programming Trained on Over 100,000 Verifiable Repositories
Anthropic
The KwaiKAT team from Kuaishou has released KAT-Coder-V2.5, an agentic coding model trained to operate in real-world repositories. Using AutoBuilder, they successfully created over 100,000 verifiable environments across 12 languages. The model leads the PinchBench benchmark with a score of 94.9 and ranks second on SWE-Bench Pro (65.2). An open version, KAT-Coder-V2.5-Dev, is available on Hugging Face.
KwaiKATチーム(Kuaishou社)は、モデルKAT-Coder-V2.5(Agile Coding Tool Coder)を発表しました。これはエージェント型のプログラミングモデルで、使い捨てのコードを生成するのではなく、実際に実行可能なリポジトリ内で動作するように学習されています。このモデルはStreamLakeを通じて利用可能で、オープン版のKAT-Coder-V2.5-DevはApache-2.0ライセンスでHugging Faceに公開されています。研究者らは、タスクの検証可能な環境を自動的に構築するシステム「AutoBuilder」を開発しました。タスクは、タスクの説明、実行可能なリポジトリ環境、検証テストのセットという3つの要素で定義されます。修正は、すべてのテストに合格した場合にのみ正しいと見なされます。タスクは実際のプルリクエストやコミットから抽出され、生のissueテキストは破棄され、代わりに構造化された説明が生成されます。AutoBuilderには、リポジトリを分析して設定スクリプトを作成するビルドエージェントと、隔離されたサンドボックスでスクリプトを実行する検証エージェントが含まれています。期待されるテストの90%以上がビルドされ、合格・不合格の結果が再現可能になった時点で環境が受理されます。事前設定されたベース環境、ビルドテンプレート、レシピライブラリの組み合わせにより、ビルド成功率は16.5%から57.2%に向上し、12言語で10万以上の検証可能な環境が得られました。学習軌跡のフィルタリングには、ほぼ成功した軌跡へのヒント、成功した軌跡への修正チェック、過学習を防ぐツールのランダム化という3つのメカニズムが使用されています。サンドボックスのインフラ問題は監査により特定されました。約16%の強化学習軌跡が、モデルのポリシーではなくサンドボックスのエラーにより失敗していました。修正後(ディスク使用の最適化、環境変数の調整、標準チャットエンドポイントの回避など)、エラー率は2%未満に低下しました。学習には非対称PPOが使用され、3段階の報酬(テストの基本スコア、行動違反のペナルティ、失敗軌跡へのボーナス)が設定されました。5つのエキスパートが、逆KLダイバージェンスを用いたマルチティーチャー・オンポリシー蒸留(Multi-Teacher On-Policy Distillation)により統合されました。ベンチマークPinchBenchでは、KAT-Coder-V2.5は94.9を記録し、Opus 4.8(93.5)を上回りました。SWE-Bench Proでは、65.2で2位(Opus 4.8は69.2)でした。Terminal-Bench 2.1では60.7(最下位)、SciCodeでは50.3でGLM-5.2と同点でした。オープン版のKAT-Coder-V2.5-Devは、別のMoEモデル(合計35Bパラメータ/アクティブ3Bパラメータ)であり、Qwen3.6-35B-A3Bを127KのSFTサンプルとRLで追加学習したものです。その結果はメインテーブルと比較できません。
出典: MarkTechPost —
原文
