Kimi K3 PAC1- ja ECOM1-vertailuissa: tulokset 204 tehtävästä ja virheanalyysi
Moonshot AI
Moonshot AI julkaisi Kimi K3:n avoimena lähdekoodina heinäkuussa. Mallia testattiin kahdessa BitGN-vertailussa (PAC1 ja ECOM1) 204 avoimella jäljityksellä. Tulokset osoittavat vahvaa suorituskykyä yksinkertaisessa haussa ja laskennassa, mutta toistuvia virheitä monitiedosto-operaatioissa, luottamattoman syötteen tarkistuksessa ja pitkien taulukoiden johdonmukaisuudessa.
Moonshot AI julkaisi Kimi K3:n avoimet painot 27. heinäkuuta yhdessä teknisen raportin kanssa. Suorituskyvyn itsenäiseksi varmentamiseksi mallia ajettiin kahdella BitGN-tehtäväjoukolla: PAC1 (asiakirjat, laskut, saapuneet, erätiedostojen muutokset) ja ECOM1 (luettelo, varasto, ostoskorit, maksut, palautukset, logistiikka). PAC1 sai 61/104 (binäärinen), ECOM1 44,75/100 (osittaisia pisteitä). 204 avointa jäljitystä mahdollistavat jokaisen komennon ja tilamuutoksen tarkastelun. PAC1:ssä yksinkertaiset haku- ja aritmeettiset tehtävät onnistuivat 90–92-prosenttisesti, mutta havaittiin kolme keskeistä virhetilannetta: täsmällisen skeeman rikkominen (samankaltaisten mutta väärien kenttänimien kirjoittaminen), ei-atomiset eräoperaatiot (osittaiset tiedostomuutokset ennen koko joukon validointia) ja estottomat luottamattoman syötteen tarkistukset (vaarallinen sisältö havaittu, mutta toiminto suoritettiin silti). ECOM1:ssä tarkka SKU-haku ja tavallinen kassa toimivat hyvin, mutta virhetilanteita olivat tilan menetys monirivisten raporttien rivien välillä, liiallinen poikkeamien merkitseminen, henkilöllisyyden tarkistuksen puuttuminen ennen yksityisten tietojen lukemista ja tilamuutokset luottamattoman syötteen vuoksi. Optimointitehtävät (lähetysaikataulutus) tuottivat toteuttamiskelpoisia mutta epäoptimaalisia suunnitelmia. Vertailu muihin julkisiin BitGN-ajoihin osoittaa Kimi K3:n olevan kilpailukykyinen yksinkertaisissa tehtävissä, mutta jäävän jälkeen monimutkaisissa monivaiheisissa rajoitteissa.
Lähde: Habr — хаб ИИ —
Alkuperäinen
