모델비즈니스 및 시장 🇷🇺 14.08.2026 09:03

Grok 4.6 출시: 절반 가격으로 GPT-5.6 수준에 도달한 방법

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI는 Grok 4.6을 출시했습니다. 회사에 따르면 이 모델은 시장에서 가장 강력한 모델 수준을 절반 가격에 제공합니다: 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러입니다. 이 모델은 Artificial Analysis의 지능 지수에서 61점을 기록하여 GPT-5.6 Sol과 동등하며, 이미 Grok Build, Cursor, Grok Bot 및 API를 통해 사용할 수 있습니다.
SpaceXAI는 Grok 4.6을 공개하며, 경쟁사 대비 절반 비용으로 최강 모델 수준에 도달했다고 주장합니다. 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러입니다. 이 모델은 이미 Grok Build 에이전트, Cursor, Grok 봇, 그리고 API를 통해 사용할 수 있으며, Cursor와 Grok Build에서는 첫 주에 사용 한도가 두 배로 제공됩니다. 핵심 수치는 독립 분석 플랫폼인 Artificial Analysis의 인텔리전스 지수(Intelligence Index)에서 61점으로, 이는 9가지 벤치마크를 종합한 결과입니다. 이는 최대 추론 모드의 GPT-5.6 Sol과 동률이며, Claude Fable 5 Max보다 1점 낮고, 한 달 전의 Grok 4.5보다 5점 높습니다. 분석가들은 SpaceXAI가 지능의 최전선에 복귀했으며, 이제 Anthropic만이 앞서 있다고 말합니다. 세부 벤치마크에서 Grok 4.6은 사무 지식 작업을 측정하는 GDPVal-AA v2에서 1753점으로 1741점인 Fable 5와 1728점인 Sol을 앞섰고, AA-Briefcase에서는 1577점으로 1574점과 1502점을 각각 제쳤습니다. 또한 법률 분야 Harvey LAB에서 15.8%로, Fable 5의 11.3%와 Sol의 2.5%를 크게 웃돌았습니다. 그러나 Terminal-Bench v3.0에서는 26%로, Sol의 34.6%와 Fable 5의 34.1%에 크게 뒤처졌지만, 이전 버전인 v2.1에서는 88.4%로 Claude Opus 5에 이어 두 번째입니다. 또한 일부 코딩 벤치마크에서는 패배합니다. DeepSWE에서는 Sol(73%)과 Fable 5(70%)에 뒤지고, FrontierCode와 APEX-SWE에서는 Fable 5에게 집니다. 가장 흥미로운 점은 동등함을 달성한 방법입니다. 머스크에 따르면 Grok 4.6은 Grok 4.5와 동일한 1조 5000억 개의 파라미터 기반 위에 구축되어 모델이 커지지 않았습니다. 스케일링 대신, 회사는 추론과 엔지니어링 주제에 대한 큐레이션된 합성 데이터와 개선된 옵티마이저를 사용하여 동일한 기반에서 더 긴 훈련 주기를 수행한 다음, SFT 및 RL 단계를 재구축했습니다. SFT 궤적은 Grok 4.5 자체에 의해 재생성되었고, 모델 검사로 문제가 있는 예제를 필터링했습니다. 즉, 이전 버전이 다음 버전을 훈련시킨 것입니다. 이제 SpaceXAI가 소유한 Cursor에서는 Grok 4.6이 아이디어 설명만으로 첫 패스에서 앱의 구조와 시각적 언어를 구축하며, 긴 궤적에서 훨씬 더 많은 자체 검증을 보여준다고 언급합니다. 즉, 다음 단계로 넘어가기 전에 자신의 작업을 테스트합니다. 훈련 중 RL 작업은 계산 커널 최적화부터 웹 개발 및 CAD까지 다양했습니다. 경제성은 7월 8일에 출시된 Grok 4.5와 동일합니다. 동일한 $2/$6이며, Artificial Analysis에 따르면 이는 Claude Opus 5($5/$25) 및 GPT-5.6 Sol($5/$30)보다 60% 이상 낮습니다. 인텔리전스 지수 작업 비용은 Kimi K3와 같은 $0.84이지만, 약간 더 높은 지능을 제공하여 지능 대비 가격의 파레토 최적 경계에 정확히 위치합니다. 특유의 토큰 효율성도 유지됩니다. AA-Briefcase에서 Grok 4.6은 긴 에이전트 작업을 평균 53턴과 5억 개의 입력 토큰으로 완료하는 반면, Claude Opus 5는 103턴과 20억 개의 토큰을 사용합니다. 캐시 적중 비용만 $0.3에서 $0.5로 증가했습니다. SpaceXAI의 출시 속도는 빠릅니다. Grok 4.5는 7월 8일, Grok 4.6은 8월 12일에 데뷔했으며, 머스크가 8월 통화에서 추정한 2.1조 파라미터의 Grok 4.7은 3~4주 후인 늦여름에 출시될 예정입니다. Cursor 인수와 이전에 출시된 Grok 봇 에이전트와 결합하여 Grok은 밈에서 자체 개발 환경, 에이전트, 모델 파이프라인을 갖춘 제품 라인으로 변모하고 있습니다.
출처: Habr — хаб ML — 원문
관련 게시물 ↓
새로운 뉴스