Kimi K3 sur PAC1 et ECOM1 : résultats de 204 tâches et analyse des échecs
Moonshot AI
Moonshot AI a open-sourcé Kimi K3 en juillet. Le modèle a été testé sur deux benchmarks BitGN (PAC1 et ECOM1) avec 204 traces ouvertes. Les résultats montrent de bonnes performances sur la récupération simple et les calculs, mais des échecs fréquents sur les opérations atomiques multi-fichiers, la vérification des entrées non fiables et la cohérence des longues tables.
Moonshot AI a publié les poids ouverts de Kimi K3 le 27 juillet, accompagnés d'un rapport technique. Pour vérifier les performances de manière indépendante, le modèle a été exécuté sur deux ensembles de tâches BitGN : PAC1 (documents, factures, boîte de réception, modifications par lots de fichiers) et ECOM1 (catalogue, inventaire, paniers, paiements, retours, logistique). PAC1 a obtenu un score de 61 sur 104 (binaire), ECOM1 de 44,75 sur 100 (crédit partiel). Les 204 traces ouvertes permettent d'inspecter chaque commande et changement d'état. Sur PAC1, les tâches simples de recherche et d'arithmétique ont atteint un taux de réussite de 90 à 92 %, mais trois modes de défaillance majeurs sont apparus : violation de schéma exact (écriture de noms de champs similaires mais incorrects), opérations par lots non atomiques (modifications partielles de fichiers avant validation complète) et vérifications non bloquantes des entrées non fiables (contenu dangereux détecté mais action tout de même exécutée). Sur ECOM1, la recherche précise de code SKU et le processus de commande standard ont bien fonctionné, mais les modes de défaillance incluaient la perte d'état entre les lignes dans les rapports multilignes, le signalement excessif d'anomalies, l'absence de vérification d'identité avant la lecture de données privées, et les changements d'état dus à des entrées non fiables. Les tâches d'optimisation (planification des expéditions) ont produit des plans réalisables mais sous-optimaux. La comparaison avec d'autres exécutions publiques de BitGN montre que Kimi K3 est compétitif sur les tâches simples mais en retard sur les contraintes complexes en plusieurs étapes.
Source: Habr — хаб ИИ —
original
