ModellerAjanlar 🇷🇺 28.07.2026 07:03

Kimi K3, PAC1 ve ECOM1'de: 204 görevin sonuçları ve başarısızlık analizi

Moonshot AIMoonshot AI
Moonshot AI, Temmuz ayında Kimi K3'ü açık kaynak olarak yayınladı. Model, 204 açık iz ile iki BitGN benchmark'ı (PAC1 ve ECOM1) üzerinde test edildi. Sonuçlar, basit sorgulama ve hesaplamalarda güçlü performans gösterirken, çok dosyalı atomik işlemler, güvenilmeyen girdi kontrolü ve uzun tablo tutarlılığında sık sık başarısız olduğunu ortaya koydu.
Moonshot AI, 27 Temmuz'da Kimi K3 modelini açık ağırlıklarıyla ve beraberinde bir teknik raporla yayınladı. Performansı bağımsız olarak doğrulamak için model, iki BitGN görev seti üzerinde çalıştırıldı: PAC1 (belgeler, faturalar, gelen kutusu, toplu dosya değişiklikleri) ve ECOM1 (katalog, envanter, sepetler, ödemeler, iadeler, lojistik). PAC1'de 104 üzerinden 61 (ikili), ECOM1'de 100 üzerinden 44,75 (kısmi kredi) puan alındı. 204 açık iz, her komut ve durum değişikliğinin incelenmesine olanak tanıyor. PAC1'de basit arama ve aritmetik görevler %90-92 başarıya ulaştı, ancak üç temel hata türü ortaya çıktı: tam şemayı ihlal etme (benzer ancak yanlış alan adları yazma), atomik olmayan toplu işlemler (tam küme doğrulamasından önce kısmi dosya değişiklikleri) ve engellemeyen güvenilmeyen girdi kontrolleri (tehlikeli içerik tespit edildi ancak işlem yine de gerçekleştirildi). ECOM1'de hassas SKU araması ve standart ödeme işlemleri iyi çalıştı, ancak hata türleri arasında çok satırlı raporlarda satırlar arasında durum kaybı, aşırı anomali bildirimi, özel verileri okumadan önce kimlik kontrollerinin eksikliği ve güvenilmeyen girdi nedeniyle durum değişiklikleri yer aldı. Optimizasyon görevleri (dağıtım planlaması) uygulanabilir ancak optimalin altında planlar üretti. Diğer halka açık BitGN çalışmalarıyla karşılaştırıldığında Kimi K3, basit görevlerde rekabetçi ancak karmaşık çok adımlı kısıtlamalarda geride kalıyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler