Grok 4.6 发布:增强代理式人工智能,改进基准测试,现可在 Cursor 和 Grok Build 中使用
xAI
xAI 发布了 Grok 4.6,这是其人工智能模型的升级版本,专注于长时间运行的代理以及复杂的交互式和视觉任务。该模型在多个基准测试中表现出竞争力,有时能匹敌或超越 GPT-5.6 Sol 和 Fable 5。Grok 4.6 现已在 Cursor 和 Grok Build 中可用,并提供应用程序编程接口(API)访问及合作伙伴平台支持。
xAI推出了Grok 4.6,在Grok 4.5的基础上,增强了长期代理任务的能力,改进了对复杂多步骤流程的处理,包括研究、编码以及将想法转化为精美的应用。该模型经过了一个扩展的训练阶段,使用了精心挑选的模型生成数据、改进的优化器和更新的方法学,随后进行了监督微调和强化学习阶段。它展示了自检和验证能力,并擅长将产品想法转化为可工作的原型,特别是在视觉和交互式项目中。安全机制得到了升级和校准,该模型经历了xAI历史上最广泛的测试。基准测试结果显示,Grok 4.6 High的AA Intelligence Index得分为61,GDPVal-AA v2得分为1753,CursorBench v3.2得分为69.9%,DeepSWE v1.1得分为65.9%,FrontierCode v1.1(扩展版)得分为61.3%,APEX-Agents得分为57.5%,Terminal-Bench v3.0得分为26%,APEX-SWE得分为56.4%,AA-Briefcase得分为1577,Harvey LAB(Vals)得分为15.8%。Grok 4.6现已在Cursor和Grok Build中可用,也可通过API及合作伙伴平台(包括OpenRouter、Vercel和Cloudflare)使用。定价为每百万输入令牌2美元,每百万输出令牌6美元,更快的版本价格翻倍。在头一周内,Grok Build和Cursor中包含的使用量将翻倍。
来源: Habr — хаб ИИ —
原文
