показатель — 61 балл в индексе интеллекта независимой аналитической платформы Artificial Analysis, который агрегирует девять бенчмарков. Это соответствует GPT-5.6 Sol в режиме максимального рассуждения, на один балл меньше, чем у Claude Fable 5 Max, и на 5 баллов выше, чем у Grok 4.5 месяцем ранее. Аналитики отмечают, что SpaceXAI вернулась на передний край интеллекта, и теперь впереди только Anthropic. По детальным бенчмаркам Grok 4.6 лидирует в GDPVal-AA v2 для офисной работы со знаниями с 1753 баллами против 1741 у Fable 5 и 1728 у Sol, а в AA-Briefcase — 1577 против 1574 и 1502 соответственно. Модель также возглавляет юридический Harvey LAB с результатом 15,8% против 11,3% у Fable 5 и 2,5% у Sol. Однако заметно отстает в Terminal-Bench v3.0: 26% против 34,6% у Sol и 34,1% у Fable 5, но в более старой версии v2.1 показывает 88,4%, уступая лишь Claude Opus 5. Модель также проигрывает на некоторых бенчмарках программирования: в DeepSWE уступает Sol (73%) и Fable 5 (70%), а в FrontierCode и APEX-SWE — Fable 5. Самый интересный аспект — как было достигнуто паритет: по словам Маска, Grok 4.6 построена на той же базе в 1,5 триллиона параметров, что и Grok 4.5, поэтому модель не выросла. Вместо масштабирования компания провела еще один, более длительный цикл обучения на той же базе с курируемыми синтетическими данными по рассуждениям и инженерным темам и улучшенным оптимизатором, затем перестроила этапы SFT (обучение с учителем) и RL (обучение с подкреплением). Траектории для SFT были регенерированы самой Grok 4.5 с фильтрацией проблемных примеров с помощью проверок модели — фактически предыдущая версия обучала следующую. В Cursor, который теперь принадлежит SpaceXAI, отмечают, что Grok 4.6 с первого раза строит структуру и визуальный язык приложения на основе описания
Показать ещё ↓