KwaiKAT Team Launches KAT-Coder-V2.5: An Agentic Model for Programming Trained on Over 100,000 Verifiable Repositories
Anthropic
The KwaiKAT team from Kuaishou has released KAT-Coder-V2.5, an agentic coding model trained to operate in real-world repositories. Using AutoBuilder, they successfully created over 100,000 verifiable environments across 12 languages. The model leads the PinchBench benchmark with a score of 94.9 and ranks second on SWE-Bench Pro (65.2). An open version, KAT-Coder-V2.5-Dev, is available on Hugging Face.
Kuaishou şirketinden KwaiKAT ekibi, KAT-Coder-V2.5 modelini (Agile Coding Tool Coder) tanıttı. Bu, tek kullanımlık kod üretmek yerine gerçek, çalıştırılabilir depolar içinde çalışmak üzere eğitilmiş bir ajan tabanlı programlama modelidir. Model StreamLake aracılığıyla erişilebilir; açık sürüm KAT-Coder-V2.5-Dev, Hugging Face'te Apache-2.0 lisansı altında yayınlanmıştır. Araştırmacılar, görevler için otomatik olarak doğrulanabilir ortamlar oluşturan AutoBuilder sistemini geliştirdi. Bir görev, üçlü olarak tanımlanır: görev açıklaması, çalıştırılabilir depo ortamı ve bir dizi doğrulama testi. Bir düzeltme, yalnızca tüm testleri geçerse doğru kabul edilir. Görevler gerçek pull request'lerden ve commit'lerden çıkarılır; ham issue metni atılır ve bunun yerine yapılandırılmış bir açıklama oluşturulur. AutoBuilder, depoyu analiz eden ve bir yapılandırma betiği yazan bir derleme ajanı ile betiği izole bir sanal alanda çalıştıran bir doğrulama ajanı içerir. Ortam kabulü, beklenen testlerin %90'ından fazlası derlendiğinde ve geçme/kalma sonuçları tekrarlanabilir olduğunda gerçekleşir. Önceden yapılandırılmış bir temel ortam, derleme şablonları ve bir tarif kitaplığının birleşimi, derleme başarı oranını %16,5'ten %57,2'ye çıkarmış ve 12 dilde 100.000'den fazla doğrulanabilir ortam elde edilmiştir. Eğitim yörüngelerini filtrelemek için üç mekanizma kullanılır: 'neredeyse başarılı' yörüngeler için ipuçları, başarılı olanlar için düzeltme kontrolleri ve aşırı öğrenmeyi önlemek için araç rastgeleleştirmesi. Sanal alan altyapı sorunları bir denetim sırasında tespit edildi: RL yörüngelerinin yaklaşık %16'sı model politikasından değil, sanal alan hatalarından dolayı başarısız oluyordu. Düzeltmelerden sonra (disk kullanım optimizasyonu, ortam değişken ayarlamaları, standart sohbet uç noktalarını atlama) hata oranı %2'nin altına düştü. Eğitim için, üç seviyeli ödül ile asimetrik PPO kullanıldı: testler için temel puanlar, davranış ihlalleri için cezalar ve başarısız yörüngeler için teşvikler. Beş uzman, ters KL diverjansı kullanılarak Multi-Teacher On-Policy Distillation ile birleştirildi. PinchBench kıyaslamasında KAT-Coder-V2.5, Opus 4.8'in (93,5) önünde 94,9 puan aldı. SWE-Bench Pro'da 65,2 ile ikinci oldu (Opus 4.8: 69,2). Terminal-Bench 2.1'de model 60,7 (son sıra) ve SciCode'da 50,3 puan alarak GLM-5.2 ile eşleşti. Açık sürüm KAT-Coder-V2.5-Dev, Qwen3.6-35B-A3B üzerinde 127K SFT örneği ve RL ile ince ayar yapılmış ayrı bir MoE modelidir (toplam 35B / 3B aktif); sonuçları ana tabloyla karşılaştırılabilir değildir.
Kaynak: MarkTechPost —
orijinal
