ModelosNegocios y Mercado 🇷🇺 14.08.2026 09:03

Grok 4.6 lanzado: cómo el modelo igualó el nivel de GPT-5.6 a la mitad de precio

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI lanzó Grok 4.6, que según la compañía iguala el nivel de los modelos más potentes del mercado a la mitad de precio: $2 por millón de tokens de entrada y $6 por millón de tokens de salida. El modelo puntúa 61 en el Índice de Inteligencia de Artificial Analysis, igual que GPT-5.6 Sol, y ya está disponible en Grok Build, Cursor, Grok Bot y a través de la API.
SpaceXAI presentó Grok 4.6, afirmando que alcanza el nivel de los modelos más potentes a la mitad del coste de los competidores: el precio es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. El modelo ya está disponible en el agente Grok Build, en Cursor, en Grok Bot y a través de la API, con el doble de límites de uso durante la primera semana en Cursor y Grok Build. La cifra clave son 61 puntos en el Índice de Inteligencia de la plataforma de análisis independiente Artificial Analysis, que agrega nueve puntos de referencia. Esto iguala a GPT-5.6 Sol en modo de razonamiento máximo, es un punto menos que Claude Fable 5 Max, y 5 puntos más que Grok 4.5 de hace un mes. Los analistas afirman que SpaceXAI ha vuelto a la frontera de la inteligencia, con solo Anthropic por delante. En puntos de referencia detallados, Grok 4.6 lidera en GDPVal-AA v2 para trabajo de oficina con 1753 puntos frente a 1741 de Fable 5 y 1728 de Sol, y en AA-Briefcase con 1577 frente a 1574 y 1502. También domina el legal Harvey LAB con un 15,8% en comparación con el 11,3% de Fable 5 y el 2,5% de Sol. Sin embargo, queda notablemente rezagado en Terminal-Bench v3.0: 26% frente al 34,6% de Sol y el 34,1% de Fable 5, aunque en la versión anterior v2.1 obtiene un 88,4%, solo superado por Claude Opus 5. También pierde en algunos puntos de referencia de codificación: en DeepSWE se queda detrás de Sol (73%) y Fable 5 (70%), y en FrontierCode y APEX-SWE pierde contra Fable 5. El aspecto más interesante es cómo se logró la paridad: según Musk, Grok 4.6 está construido sobre la misma base de 1,5 billones de parámetros que Grok 4.5, por lo que el modelo no creció. En lugar de escalar, la compañía realizó otro ciclo de entrenamiento más largo sobre la misma base con datos sintéticos seleccionados sobre razonamiento y temas de ingeniería, y un optimizador mejorado, y luego reconstruyó las etapas de ajuste fino supervisado y refuerzo. Las trayectorias de ajuste fino supervisado fueron regeneradas por el propio Grok 4.5, filtrando ejemplos problemáticos con comprobaciones del modelo: efectivamente, la versión anterior entrenó a la siguiente. En Cursor, ahora propiedad de SpaceXAI, señalan que Grok 4.6 construye la estructura y el lenguaje visual de una aplicación desde el primer intento basándose en una descripción de la idea, y en trayectorias largas muestra significativamente más autocomprobación: prueba su propio trabajo antes de continuar. Las tareas de refuerzo durante el entrenamiento iban desde optimizar núcleos de computación hasta desarrollo web y CAD. La economía se mantiene desde Grok 4.5, lanzado el 8 de julio: los mismos 2/6 dólares, que según Artificial Analysis es más de un 60% inferior a Claude Opus 5 (5/25 dólares) y GPT-5.6 Sol (5/30 dólares). La tarea del Índice de Inteligencia cuesta 0,84 dólares para el modelo, como Kimi K3, pero con algo más de inteligencia, situándose exactamente en la frontera de Pareto entre inteligencia y precio. Su característica eficiencia de tokens persiste: en AA-Briefcase, Grok 4.6 completa una tarea agéntica larga en un promedio de 53 turnos y medio billón de tokens de entrada, frente a los 103 turnos y dos billones de Claude Opus 5. Solo aumentaron los aciertos de caché, de 0,3 a 0,5 dólares por millón. SpaceXAI tiene un fuerte ritmo de lanzamiento: Grok 4.5 debutó el 8 de julio, Grok 4.6 el 12 de agosto, y Grok 4.7 con 2,1 billones de parámetros que Musk estimó en la llamada de agosto que estaría en tres o cuatro semanas, es decir, a finales del verano. Combinado con la compra de Cursor y el agente Grok Bot lanzado anteriormente, Grok se está transformando de un meme a una línea de productos con su propio entorno de desarrollo, agente y canal de modelos.
Fuente: Habr — хаб ML — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas