ModellenBedrijf & Markt 🇷🇺 14.08.2026 09:03

Grok 4.6 uitgebracht: hoe het model GPT-5.6-niveau evenaart voor de helft van de prijs

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI heeft Grok 4.6 uitgebracht, dat volgens het bedrijf het niveau van de krachtigste modellen op de markt evenaart voor de helft van de prijs: $2 per miljoen invoertokens en $6 per miljoen uitvoertokens. Het model scoort 61 op de Intelligence Index van Artificial Analysis, gelijk aan GPT-5.6 Sol, en is al beschikbaar in Grok Build, Cursor, Grok Bot en via API.
SpaceXAI heeft Grok 4.6 geïntroduceerd en claimt dat het het niveau van de sterkste modellen bereikt tegen de helft van de kosten van concurrenten: de prijs is $2 per miljoen invoertokens en $6 per miljoen uitvoertokens. Het model is al toegankelijk in de Grok Build-agent, in Cursor, in de Grok Bot en via de API, met dubbele gebruikslimieten voor de eerste week in Cursor en Grok Build. Het belangrijkste cijfer is 61 punten op de Intelligence Index van het onafhankelijke analyseplatform Artificial Analysis, dat negen benchmarks bundelt. Dit komt overeen met GPT-5.6 Sol in de maximale redeneringsmodus, is één punt minder dan Claude Fable 5 Max en is 5 punten hoger dan Grok 4.5 van een maand eerder. Analisten zeggen dat SpaceXAI is teruggekeerd naar de frontlinie van intelligentie, met alleen Anthropic nog voorop. Op gedetailleerde benchmarks leidt Grok 4.6 op GDPVal-AA v2 voor kantoorgerelateerd kenniswerk met 1753 punten tegen 1741 voor Fable 5 en 1728 voor Sol, en op AA-Briefcase met 1577 tegen 1574 en 1502. Het scoort ook het hoogst op de juridische Harvey LAB met 15,8% vergeleken met 11,3% voor Fable 5 en 2,5% voor Sol. Het blijft echter duidelijk achter op Terminal-Bench v3.0: 26% tegen 34,6% voor Sol en 34,1% voor Fable 5, maar op de oudere v2.1-versie scoort het 88,4%, tweede alleen na Claude Opus 5. Het verliest ook op sommige codeerbenchmarks: op DeepSWE blijft het achter bij Sol (73%) en Fable 5 (70%), en op FrontierCode en APEX-SWE verliest het van Fable 5. Het meest interessante aspect is hoe de gelijkheid is bereikt: volgens Musk is Grok 4.6 gebouwd op dezelfde basis van 1,5 biljoen parameters als Grok 4.5, dus het model is niet gegroeid. In plaats van schalen heeft het bedrijf nog een langere trainingscyclus op dezelfde basis gedraaid met geselecteerde synthetische gegevens over redeneren en technische onderwerpen en een verbeterde optimizer, en vervolgens de SFT- en RL-fasen herbouwd. SFT-trajecten werden opnieuw gegenereerd door Grok 4.5 zelf, waarbij problematische voorbeelden met modelcontroles werden uitgefilterd - effectief trainde de vorige versie de volgende. Bij Cursor, nu eigendom van SpaceXAI, merken ze op dat Grok 4.6 de structuur en visuele taal van een app vanaf de eerste poging opbouwt op basis van een ideeomschrijving, en bij lange trajecten vertoont het aanzienlijk meer zelfcontrole: het test zijn eigen werk voordat het verder gaat. RL-taken tijdens de training varieerden van het optimaliseren van computationele kernels tot webontwikkeling en CAD. De economie blijft hetzelfde als die van Grok 4.5, uitgebracht op 8 juli: dezelfde $2/$6, wat volgens Artificial Analysis meer dan 60% lager is dan Claude Opus 5 ($5/$25) en GPT-5.6 Sol ($5/$30). De Intelligence Index-taak kost $0,84 voor het model, net als Kimi K3, maar met iets meer intelligentie, waardoor het precies op de Pareto-frontier van intelligentie versus prijs ligt. De kenmerkende tokenefficiëntie blijft: op AA-Briefcase voltooit Grok 4.6 een lange agentische taak in gemiddeld 53 beurten en een half miljard invoertokens, tegen 103 beurten en twee miljard voor Claude Opus 5. Alleen cache-hits zijn gestegen, van $0,3 naar $0,5 per miljoen. SpaceXAI heeft een sterk release-tempo: Grok 4.5 debuteerde op 8 juli, Grok 4.6 op 12 augustus, en Grok 4.7 met 2,1 biljoen parameters, die Musk tijdens de augustus-call op drie tot vier weken schatte, dus tegen het einde van de zomer. Gecombineerd met de aankoop van Cursor en de eerder gelanceerde Grok Bot-agent, verandert Grok van een meme in een productlijn met een eigen ontwikkelomgeving, agent en modelpijplijn.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws