Grok 4.6 publié : benchmarks et le prix des tâches longues
SpaceXAI a publié Grok 4.6 avec 500 000 jetons de contexte, quatre modes de raisonnement, et un accent sur les travaux agentiques longs. Lors des premiers tests, il se comporte au niveau des principaux concurrents, menant CursorBench à un coût moyen de 2,81 dollars par tâche. Cependant, le prix double pour les contextes dépassant 200 000 jetons.
Le 12 août, SpaceXAI a publié Grok 4.6, qui propose 500 000 jetons de contexte, quatre modes de raisonnement et un accent explicite sur le travail agentique étendu. Dans les premiers benchmarks, le modèle performe au niveau des concurrents les plus forts et se distingue dans CursorBench, avec un coût moyen de 2,81 dollars par tâche. Ce chiffre semble attrayant, mais le long contexte agit comme un supplément caché : après 200 000 jetons, le tarif double. Cet article examine où le modèle s'améliore réellement, combien coûte une exécution longue et qui devrait l'essayer dès maintenant.
Source: Habr — хаб ИИ —
original
