Kimi K3:2.8万亿参数与“鹈鹕”基准测试的新视角
Moonshot AI
DeepSeek
Anthropic
OpenAI
Google/DeepMind
中国实验室Moonshot AI发布了Kimi K3模型,拥有2.8万亿参数,号称首个“开放3T级”模型。K3超越了Claude Opus 4.8 max和GPT-5.5 high,但落后于Claude Fable 5和GPT-5.6 Sol,成本为每百万输入token 3美元、每百万输出token 15美元,在中国模型中最为昂贵。作者还指出,“鹈鹕”基准测试与模型质量的相关性正在减弱,但仍可用于快速评估。该模型已通过网站和API提供,承诺在7月27日前开放权重。
中国实验室Moonshot AI发布了其称为“迄今最强”的模型——拥有2.8万亿参数的Kimi K3。该公司将其定位为首款“开放3T级别”的模型(2.8万亿四舍五入至3万亿),超越了DeepSeek及其1.6T参数的v4 Pro。根据其自有基准测试,K3在多数指标上优于Claude Opus 4.8 max和GPT-5.5 high,但落后于Claude Fable 5和GPT-5.6 Sol。据Artificial Analysis的报告,在其私有评估中,K3的“长期知识”得分为Elo 1547,比Kimi K2.6高出732分,仅次于Claude Fable 5。单次任务成本(0.94美元)接近GPT-5.6 Sol(1.04美元),大约是Opus 4.8(1.80美元)的一半,但高于其他开放模型。与K2.6相比,K3的Token使用量降低了21%。该模型还在Arena.ai的Frontend Code排行榜上领先,甚至超越了Claude Fable 5。API价格方面,每百万输入Token 3美元,每百万输出Token 15美元——与Anthropic的Claude Sonnet系列持平,使K3成为中国AI实验室中最贵的模型。这相比Kimi K2.6(每百万输入/输出0.95美元/4美元)有显著上涨。2.8万亿参数是此前1T模型的2倍有余。作者通过OpenRouter测试了K3,生成了一个骑自行车的鹈鹕的SVG图像。该请求消耗了95个输入Token和16,658个输出Token(其中13,241个为推理Token),成本为25美分。在二次处理生成的SVG时,模型正确描述了图像(成本0.6美分)。作者指出,21个月以来,“鹈鹕”测试与模型整体质量的相关性已经丧失——目前表现最好的是GLM-5.2,但它仍未达到Fable级别。不过,该测试仍可作为“Hello World”使用:它能促使尝试模型,提供粗略的成本和推理时间估算,检验基本的几何理解能力以及生成正确SVG的能力。对于K3,测试发现模型目前仅使用单一推理强度级别(“max”),消耗大量推理Token,并提示可能存在隐藏的系统提示(85个Token)。模型生成的视觉描述质量相当不错。
来源: Simon Willison —
原文
