モデルビジネス・市場 🇷🇺 14.08.2026 09:03

Grok 4.6リリース:半額でGPT-5.6レベルに到達したモデル

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAIはGrok 4.6をリリースしました。同社によると、このモデルは市場で最も強力なモデルのレベルに半額で到達しています。入力100万トークンあたり2ドル、出力100万トークンあたり6ドル。このモデルはArtificial Analysisのインテリジェンス指数で61点を獲得し、GPT-5.6 Solと同点です。すでにGrok Build、Cursor、Grok Bot、APIで利用可能です。
SpaceXAIはGrok 4.6を発表し、競合他社の半分のコストで最強モデルの水準に達したと主張している。料金は入力トークン100万あたり2ドル、出力トークン100万あたり6ドル。このモデルはすでにGrok Buildエージェント、Cursor、Grok Bot、APIで利用可能で、CursorとGrok Buildでは最初の1週間は利用制限が2倍になる。主要な数値は、独立系分析プラットフォームであるArtificial Analysisのインテリジェンス指数で61ポイントで、これは9つのベンチマークを統合したものだ。これは最大推論モードのGPT-5.6 Solと同等で、Claude Fable 5 Maxより1ポイント低く、1か月前のGrok 4.5より5ポイント高い。アナリストは、SpaceXAIが知能の最前線に戻り、Anthropicだけが先行していると述べている。詳細なベンチマークでは、Grok 4.6はオフィス知識業務向けのGDPVal-AA v2で1753点(Fable 5は1741点、Solは1728点)、AA-Briefcaseでは1577点(Fable 5は1574点、Solは1502点)でトップ。また、法律分野のHarvey LABでは15.8%で、Fable 5の11.3%、Solの2.5%を上回った。しかし、Terminal-Bench v3.0では26%で、Solの34.6%、Fable 5の34.1%に大きく遅れを取るが、旧バージョンのv2.1では88.4%で、Claude Opus 5に次ぐ2位だ。コーディングのベンチマークでも負けており、DeepSWEではSol(73%)とFable 5(70%)に劣り、FrontierCodeとAPEX-SWEではFable 5に敗れている。最も興味深いのは、同等性がどのように達成されたかだ。マスク氏によると、Grok 4.6はGrok 4.5と同じ1.5兆パラメータのベース上に構築されており、モデルは成長していない。スケーリングの代わりに、同社は同じベースに対して、推論とエンジニアリングのトピックに関する厳選された合成データと改善されたオプティマイザを使用して、別のより長いトレーニングサイクルを実行し、その後SFTとRLの段階を再構築した。SFTの軌跡はGrok 4.5自身によって再生成され、モデルチェックで問題のある例をフィルタリングした。実質的に、前のバージョンが次のバージョンを訓練したのだ。現在SpaceXAIが所有するCursorでは、Grok 4.6がアイデアの説明から最初のパスでアプリの構造とビジュアル言語を構築し、長い軌跡では自己チェックが大幅に増加している(先に進む前に自分の作業をテストする)。トレーニング中のRLタスクは、計算カーネルの最適化からWeb開発、CADまで多岐にわたった。経済性は7月8日にリリースされたGrok 4.5から引き継がれており、同じ$2/$6で、Artificial Analysisによると、Claude Opus 5($5/$25)やGPT-5.6 Sol($5/$30)より60%以上安い。インテリジェンス指数タスクのコストはモデルで0.84ドルで、Kimi K3と同じだが、わずかに高い知能を持つため、知能対価格のパレートフロンティア上に正確に位置している。特徴的なトークン効率は引き続き維持されており、AA-Briefcaseでは、Grok 4.6は長いエージェントタスクを平均53ターンと5億入力トークンで完了するのに対し、Claude Opus 5は103ターンと20億トークン。キャッシュヒットのみ増加し、100万あたり0.3ドルから0.5ドルになった。SpaceXAIのリリースペースは速い。Grok 4.5は7月8日、Grok 4.6は8月12日、そしてマスク氏が8月の電話会議で推定した2.1兆パラメータのGrok 4.7は3〜4週間後、つまり夏の終わりまでに登場する見込みだ。Cursorの買収と先に開始されたGrok Botエージェントを組み合わせることで、Grokはミームから、独自の開発環境、エージェント、モデルパイプラインを備えた製品ラインへと変貌しつつある。
出典: Habr — хаб ML — 原文
関連記事 ↓
新着ニュース