ModèlesAffaires et Marché 🇷🇺 14.08.2026 09:03

Grok 4.6 publié : comment le modèle a égalé le niveau de GPT-5.6 à moitié prix

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI a publié Grok 4.6, qui, selon la société, atteint le niveau des modèles les plus puissants du marché à moitié prix : 2 dollars par million de jetons en entrée et 6 dollars par million de jetons en sortie. Le modèle obtient 61 sur l'indice d'intelligence d'Artificial Analysis, soit l'égal de GPT-5.6 Sol, et est déjà disponible dans Grok Build, Cursor, Grok Bot et via l'API.
SpaceXAI a présenté Grok 4.6, affirmant qu'il atteint le niveau des modèles les plus puissants pour moitié moins cher que ses concurrents : le prix est de 2 dollars par million de jetons en entrée et de 6 dollars par million de jetons en sortie. Le modèle est déjà disponible dans l'agent Grok Build, dans Cursor, dans le Grok Bot et via l'API, avec des limites d'utilisation doublées pour la première semaine dans Cursor et Grok Build. Le chiffre clé est de 61 points sur l'Intelligence Index de la plateforme d'analyse indépendante Artificial Analysis, qui agrège neuf références. Cela correspond à GPT-5.6 Sol en mode de raisonnement maximal, soit un point de moins que Claude Fable 5 Max, et 5 points de plus que Grok 4.5 un mois plus tôt. Les analystes affirment que SpaceXAI est revenu à la frontière de l'intelligence, avec seulement Anthropic en tête. Sur des références détaillées, Grok 4.6 mène sur GDPVal-AA v2 pour le travail de bureau avec 1753 points contre 1741 pour Fable 5 et 1728 pour Sol, et sur AA-Briefcase avec 1577 contre 1574 et 1502. Il domine également le test juridique Harvey LAB avec 15,8% contre 11,3% pour Fable 5 et 2,5% pour Sol. Cependant, il est nettement en retard sur Terminal-Bench v3.0 : 26% contre 34,6% pour Sol et 34,1% pour Fable 5, mais sur la version plus ancienne v2.1, il obtient 88,4%, deuxième seulement derrière Claude Opus 5. Il perd aussi sur certains benchmarks de codage : sur DeepSWE, il est derrière Sol (73%) et Fable 5 (70%), et sur FrontierCode et APEX-SWE, il s'incline face à Fable 5. L'aspect le plus intéressant est la manière dont la parité a été atteinte : selon Musk, Grok 4.6 est construit sur la même base de 1,5 billion de paramètres que Grok 4.5, donc le modèle n'a pas grandi. Au lieu de passer à l'échelle, l'entreprise a effectué un autre cycle d'entraînement plus long sur la même base avec des données synthétiques curatées sur des sujets de raisonnement et d'ingénierie et un optimiseur amélioré, puis a reconstruit les étapes SFT et RL. Les trajectoires SFT ont été régénérées par Grok 4.5 lui-même, en filtrant les exemples problématiques avec des vérifications du modèle — en fait, la version précédente a formé la suivante. Dans Cursor, désormais détenu par SpaceXAI, ils notent que Grok 4.6 construit la structure et le langage visuel d'une application dès la première passe à partir d'une description d'idée, et sur de longues trajectoires, il montre nettement plus d'auto-vérification : il teste son propre travail avant de continuer. Les tâches RL pendant l'entraînement allaient de l'optimisation de noyaux computationnels au développement web et à la CAO. L'économie reste celle de Grok 4.5, sorti le 8 juillet : les mêmes 2/6 dollars, ce qui, selon Artificial Analysis, est plus de 60% inférieur à Claude Opus 5 (5/25 dollars) et GPT-5.6 Sol (5/30 dollars). Le coût de la tâche Intelligence Index est de 0,84 dollar pour le modèle, comme Kimi K3, mais avec un peu plus d'intelligence, le plaçant exactement sur la frontière de Pareto entre intelligence et prix. Son efficacité en jetons signature persiste : sur AA-Briefcase, Grok 4.6 accomplit une tâche agentique longue en moyenne en 53 tours et un demi-milliard de jetons en entrée, contre 103 tours et deux milliards pour Claude Opus 5. Seuls les hits de cache ont augmenté, passant de 0,3 à 0,5 dollar par million. SpaceXAI a un rythme de sortie soutenu : Grok 4.5 a fait ses débuts le 8 juillet, Grok 4.6 le 12 août, et Grok 4.7 avec 2,1 billions de paramètres, Musk a estimé lors de l'appel d'août qu'il serait disponible dans trois à quatre semaines, c'est-à-dire d'ici la fin de l'été. Combiné à l'achat de Cursor et à l'agent Grok Bot lancé précédemment, Grok se transforme d'un mème en une gamme de produits avec son propre environnement de développement, agent et pipeline de modèles.
Source: Habr — хаб ML — original
Nos articles précédents sur ce sujet ↓
Infos fraîches