Grok 4.6发布:该模型如何以半价匹配GPT-5.6水平
Anthropic
OpenAI
Moonshot AI
SpaceXAI发布了Grok 4.6,该公司称其以半价匹配市场上最强大模型的水平:每百万输入代币2美元,每百万输出代币6美元。该模型在Artificial Analysis的智能指数上得分为61,与GPT-5.6 Sol相当,并已在Grok Build、Cursor、Grok Bot以及通过API提供。
SpaceXAI推出了Grok 4.6,声称其性能达到最强模型水平,而成本仅为竞争对手的一半:输入每百万token收费2美元,输出每百万token收费6美元。该模型已可在Grok Build代理、Cursor、Grok Bot以及API中使用,并且在Cursor和Grok Build中首周使用限额翻倍。关键数据是独立分析平台Artificial Analysis的智能指数得分为61分,该指数综合了九个基准测试。这与GPT-5.6 Sol在最大推理模式下的得分持平,比Claude Fable 5 Max低1分,比一个月前的Grok 4.5高出5分。分析人士称,SpaceXAI已重返智能前沿,目前只有Anthropic领先。在详细基准测试中,Grok 4.6在面向办公知识工作的GDPVal-AA v2中领先,得分为1753,而Fable 5为1741,Sol为1728;在AA-Briefcase中,得分为1577,而Fable 5为1574,Sol为1502。在法律领域的Harvey LAB中,其得分为15.8%,而Fable 5为11.3%,Sol为2.5%。然而,它在Terminal-Bench v3.0上明显落后:得分为26%,而Sol为34.6%,Fable 5为34.1%;但在较旧的v2.1版本中,其得分为88.4%,仅次于Claude Opus 5。在一些编程基准测试中它也有所不如:在DeepSWE上,它落后于Sol(73%)和Fable 5(70%);在FrontierCode和APEX-SWE上,它输给了Fable 5。最有趣的是实现这一性能持平的方式:据马斯克称,Grok 4.6基于与Grok 4.5相同的1.5万亿参数基础模型,因此模型规模并未增大。该公司没有进行扩展,而是在相同基础模型上又进行了一轮更长的训练,使用针对推理和工程主题精选的合成数据,并改进了优化器,然后重建了SFT和RL阶段。SFT轨迹由Grok 4.5自身重新生成,并通过模型检查过滤掉有问题的示例——实际上,前一个版本训练了后一个版本。在现归SpaceXAI所有的Cursor中,他们指出,Grok 4.6能根据想法描述在首轮草稿中构建应用的结构和视觉语言,并且在长轨迹中表现出明显更多的自我检查:在继续之前会测试自己的工作。训练中的RL任务包括从优化计算内核到Web开发和CAD。经济性延续自7月8日发布的Grok 4.5:同样的$2/$6定价,根据Artificial Analysis,这比Claude Opus 5($5/$25)和GPT-5.6 Sol($5/$30)低60%以上。该模型在智能指数任务上的成本为$0.84,与Kimi K3相同,但智能程度略高,使其正好处于智能与价格比的前沿。其标志性的token效率依然存在:在AA-Briefcase上,Grok 4.6完成一项长代理任务平均需要53轮和5亿输入token,而Claude Opus 5则需要103轮和20亿token。只有缓存命中价格有所上涨,从每百万token $0.3涨至$0.5。SpaceXAI发布节奏紧凑:Grok 4.5于7月8日推出,Grok 4.6于8月12日推出,而马斯克在8月的电话会议上估计,参数规模为2.1万亿的Grok 4.7将在三到四周内发布,即夏末之前。结合对Cursor的收购以及此前推出的Grok Bot代理,Grok正从一个梗转变为拥有自家开发环境、代理和模型流水线的产品线。
来源: Habr — хаб ML —
原文
