Kimi K3 op PAC1 en ECOM1: resultaten van 204 taken en foutanalyse
Moonshot AI
Moonshot AI heeft Kimi K3 in juli open-source gemaakt. Het model werd getest op twee BitGN-benchmarks (PAC1 en ECOM1) met 204 open traces. De resultaten tonen sterke prestaties op eenvoudig opzoekwerk en berekeningen, maar frequente fouten bij multi-bestand atomaire operaties, controle van onbetrouwbare invoer en consistentie over lange tabellen.
Moonshot AI heeft op 27 juli open gewichten voor Kimi K3 gepubliceerd, samen met een technisch rapport. Om de prestaties onafhankelijk te verifiëren, werd het model getest op twee BitGN-taaksets: PAC1 (documenten, facturen, inbox, batchbestandswijzigingen) en ECOM1 (catalogus, voorraad, winkelwagens, betalingen, retouren, logistiek). PAC1 scoorde 61 van de 104 (binair), ECOM1 44,75 van de 100 (gedeeltelijke punten). De 204 open traces maken inspectie van elke opdracht en statuswijziging mogelijk. Op PAC1 behaalden eenvoudige zoek- en rekentaken 90-92% succes, maar er traden drie belangrijke faalwijzen op: het schenden van exacte schema's (schrijven van vergelijkbare maar verkeerde veldnamen), niet-atomaire batchbewerkingen (gedeeltelijke bestandswijzigingen voordat de volledige set is gevalideerd) en niet-blokkerende controles op onvertrouwde invoer (gevaarlijke inhoud gedetecteerd, maar actie toch uitgevoerd). Op ECOM1 werkten nauwkeurig SKU-zoeken en standaard afrekenen goed, maar faalwijzen omvatten verlies van status tussen rijen in rapporten met meerdere regels, overmatige anomalie-markering, ontbrekende identiteitscontroles voordat privégegevens worden gelezen, en statuswijzigingen door onvertrouwde invoer. Optimalisatietaken (dispatch planning) leverden haalbare maar suboptimale plannen op. Vergelijking met andere openbare BitGN-runs toont dat Kimi K3 concurrerend is op eenvoudige taken, maar achterblijft bij complexe taken met meerdere stappen en randvoorwaarden.
Bron: Habr — хаб ИИ —
origineel
