⚡ BREAKING
Kimi K3: 2,8 biljoen parameters en wat we nog kunnen leren van de Pelikanen-benchmark
Moonshot AI
DeepSeek
Anthropic
OpenAI
Google/DeepMind
Het Chinese AI-lab Moonshot AI heeft Kimi K3 uitgebracht, een model met 2,8 biljoen parameters. Het beweert beter te presteren dan Claude Opus 4.8 en GPT-5.5, maar blijft achter bij Claude Fable 5 en GPT-5.6 Sol. Het model is beschikbaar via de website en API, met open gewichten beloofd tegen 27 juli 2026. Simon Willison testte het met zijn SVG-benchmark 'pelikaan op een fiets' en merkte hoge kosten en veel redeneertokens op.
Moonshot AI heeft Kimi K3 aangekondigd, hun meest capabele model met 2,8 biljoen parameters, nu beschikbaar via hun website en API. De open-weight-release staat gepland voor 27 juli 2026. Moonshot beweert dat het model Claude Opus 4.8 en GPT-5.5 verslaat op zelfgerapporteerde benchmarks, maar verliest van Claude Fable 5 en GPT-5.6 Sol. De prijzen zijn $3 per miljoen invoertokens en $15 per miljoen uitvoertokens, waarmee het tot nu toe het duurste Chinese AI-model is. Simon Willison testte K3 met zijn pelikaan SVG-benchmark via OpenRouter en betaalde $0,25 voor de uitvoer. Het model gebruikte 95 invoertokens en 16.658 uitvoertokens (13.241 redeneertokens). De gegenereerde SVG was van slechte visuele kwaliteit, maar de alt-tekst was goed. Willison merkt op dat de pelikaanbenchmark niet langer voorspellend is voor de algehele modelkwaliteit, maar nog steeds nuttig is voor 'hello world'-testen, kosteninschatting en een basiscontrole van de mogelijkheden.
Bron: Simon Willison —
origineel
