Grok 4.6 发布:基准测试与长任务的价格
SpaceXAI 发布了 Grok 4.6,具备 50 万上下文令牌、四种推理模式,并专注于长周期智能体工作。初期测试中,其性能与顶级竞品相当,在 CursorBench 上领先,平均每任务成本为 2.81 美元。然而,对于超过 20 万令牌的上下文,价格会翻倍。
8月12日,SpaceXAI发布了Grok 4.6,其特色包括500,000个上下文标记、四种推理模式,并明确聚焦于扩展型代理工作。在初步基准测试中,该模型与最强竞争对手表现相当,并在CursorBench中领先,平均每项任务成本为2.81美元。这个数字看起来很有吸引力,但长上下文是一个隐藏的附加项:超过200,000个标记后,费率翻倍。本文探讨了该模型在哪些方面真正有所改进、长时间运行的成本是多少,以及现在谁应该尝试它。
来源: Habr — хаб ИИ —
原文
