Grok 4.6 Lançado: Como o Modelo Igualou o Nível do GPT-5.6 pela Metade do Preço
Anthropic
OpenAI
Moonshot AI
A SpaceXAI lançou o Grok 4.6, que segundo a empresa iguala o nível dos modelos mais poderosos do mercado pela metade do preço: US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. O modelo pontua 61 no Índice de Inteligência da Artificial Analysis, igual ao GPT-5.6 Sol, e já está disponível no Grok Build, Cursor, Grok Bot e via API.
A SpaceXAI apresentou o Grok 4.6, afirmando que atinge o nível dos modelos mais fortes com metade do custo dos concorrentes: o preço é de US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída. O modelo já está acessível no agente Grok Build, no Cursor, no Grok Bot e por meio da API, com limites de uso dobrados na primeira semana no Cursor e no Grok Build. O número-chave é 61 pontos no Índice de Inteligência da plataforma de análise independente Artificial Analysis, que agrega nove benchmarks. Isso corresponde ao GPT-5.6 Sol no modo de raciocínio máximo, é um ponto a menos que o Claude Fable 5 Max, e é 5 pontos maior que o Grok 4.5 de um mês atrás. Analistas dizem que a SpaceXAI voltou à fronteira da inteligência, com apenas a Anthropic à frente. Em benchmarks detalhados, o Grok 4.6 lidera no GDPVal-AA v2 para trabalho de escritório com 1753 pontos contra 1741 do Fable 5 e 1728 do Sol, e no AA-Briefcase com 1577 contra 1574 e 1502. Ele também lidera no Harvey LAB jurídico com 15,8%, em comparação com 11,3% do Fable 5 e 2,5% do Sol. No entanto, fica notavelmente atrás no Terminal-Bench v3.0: 26% contra 34,6% do Sol e 34,1% do Fable 5, mas na versão mais antiga v2.1 ele pontua 88,4%, ficando em segundo lugar atrás apenas do Claude Opus 5. Ele também perde em alguns benchmarks de codificação: no DeepSWE, fica atrás do Sol (73%) e do Fable 5 (70%), e no FrontierCode e no APEX-SWE, perde para o Fable 5. O aspecto mais interessante é como a paridade foi alcançada: de acordo com Musk, o Grok 4.6 é construído sobre a mesma base de 1,5 trilhão de parâmetros do Grok 4.5, então o modelo não cresceu. Em vez de escala, a empresa executou outro ciclo de treinamento mais longo na mesma base, com dados sintéticos curados sobre tópicos de raciocínio e engenharia e um otimizador melhorado, e depois reconstruiu os estágios de SFT e RL. As trajetórias do SFT foram regeneradas pelo próprio Grok 4.5, filtrando exemplos problemáticos com verificações de modelo—efetivamente, a versão anterior treinou a próxima. No Cursor, agora de propriedade da SpaceXAI, eles observam que o Grok 4.6 constrói a estrutura e a linguagem visual de um aplicativo desde a primeira passagem com base na descrição de uma ideia, e em trajetórias longas ele mostra significativamente mais autoverificação: ele testa seu próprio trabalho antes de continuar. As tarefas de RL durante o treinamento variaram desde a otimização de núcleos computacionais até o desenvolvimento web e CAD. A economia permanece a mesma do Grok 4.5, lançado em 8 de julho: os mesmos US$ 2/US$ 6, que, de acordo com a Artificial Analysis, é mais de 60% menor do que o Claude Opus 5 (US$ 5/US$ 25) e o GPT-5.6 Sol (US$ 5/US$ 30). O custo da tarefa do Índice de Inteligência é de US$ 0,84 para o modelo, como o Kimi K3, mas com um pouco mais de inteligência, colocando-o exatamente na fronteira de Pareto de inteligência versus preço. Sua eficiência de tokens característica persiste: no AA-Briefcase, o Grok 4.6 conclui uma tarefa agêntica longa em média em 53 turnos e meio bilhão de tokens de entrada, contra 103 turnos e dois bilhões do Claude Opus 5. Apenas os hits de cache aumentaram, de US$ 0,3 para US$ 0,5 por milhão. A SpaceXAI tem um ritmo forte de lançamentos: o Grok 4.5 estreou em 8 de julho, o Grok 4.6 em 12 de agosto, e o Grok 4.7 com 2,1 trilhões de parâmetros, que Musk estimou na chamada de agosto como estando a três ou quatro semanas de distância, ou seja, até o final do verão. Combinado com a compra do Cursor e o agente Grok Bot lançado anteriormente, o Grok está se transformando de um meme em uma linha de produtos com seu próprio ambiente de desenvolvimento, agente e pipeline de modelos.
Fonte: Habr — хаб ML —
original
