ModelAgen 🇷🇺 28.07.2026 07:03

Kimi K3 di PAC1 dan ECOM1: hasil 204 tugas dan analisis kegagalan

Moonshot AIMoonshot AI
Moonshot AI membuka sumber Kimi K3 pada bulan Juli. Model ini diuji pada dua benchmark BitGN (PAC1 dan ECOM1) dengan 204 jejak terbuka. Hasil menunjukkan kinerja yang kuat pada pengambilan sederhana dan perhitungan, tetapi sering gagal pada operasi atomik multi-file, pemeriksaan input yang tidak tepercaya, dan konsistensi tabel panjang.
Moonshot AI merilis bobot terbuka untuk Kimi K3 pada 27 Juli beserta laporan teknis. Untuk memverifikasi kinerja secara independen, model dijalankan pada dua set tugas BitGN: PAC1 (dokumen, faktur, kotak masuk, perubahan file batch) dan ECOM1 (katalog, inventaris, keranjang belanja, pembayaran, pengembalian, logistik). PAC1 mendapat skor 61 dari 104 (biner), ECOM1 44,75 dari 100 (kredit parsial). 204 jejak terbuka memungkinkan pemeriksaan setiap perintah dan perubahan status. Pada PAC1, tugas pencarian sederhana dan aritmetika mencapai tingkat keberhasilan 90-92%, tetapi muncul tiga mode kegagalan utama: melanggar skema yang tepat (menulis nama kolom yang mirip namun salah), operasi batch non-atomic (perubahan file parsial sebelum validasi set lengkap), dan pemeriksaan input tidak tepercaya non-blocking (konten berbahaya terdeteksi tetapi tindakan tetap dijalankan). Pada ECOM1, pencarian SKU presisi dan checkout standar berfungsi dengan baik, tetapi mode kegagalan meliputi kehilangan status antar baris dalam laporan multi-baris, penandaan anomali berlebihan, ketiadaan pemeriksaan identitas sebelum membaca data pribadi, dan perubahan status akibat input tidak tepercaya. Tugas optimasi (penjadwalan pengiriman) menghasilkan rencana yang layak namun kurang optimal. Perbandingan dengan eksekusi BitGN publik lainnya menunjukkan Kimi K3 kompetitif pada tugas sederhana namun tertinggal pada kendala multi-langkah yang kompleks.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru