Grok 4.6 veröffentlicht: Wie das Modell das GPT-5.6-Niveau zum halben Preis erreichte
Anthropic
OpenAI
Moonshot AI
SpaceXAI veröffentlichte Grok 4.6, das laut Unternehmen das Niveau der leistungsstärksten Modelle auf dem Markt zum halben Preis erreicht: 2 Dollar pro Million Eingabe-Token und 6 Dollar pro Million Ausgabe-Token. Das Modell erzielt 61 im Intelligenzindex von Artificial Analysis, gleichauf mit GPT-5.6 Sol, und ist bereits in Grok Build, Cursor, Grok Bot und über die API verfügbar.
SpaceXAI hat Grok 4.6 vorgestellt und behauptet, das Niveau der stärksten Modelle zu erreichen, bei halben Kosten im Vergleich zur Konkurrenz: Der Preis liegt bei 2 Dollar pro Million Eingabe-Token und 6 Dollar pro Million Ausgabe-Token. Das Modell ist bereits im Grok Build Agenten, in Cursor, im Grok Bot und über die API verfügbar, mit doppelten Nutzungslimits in der ersten Woche in Cursor und Grok Build. Die entscheidende Zahl ist 61 Punkte im Intelligence Index der unabhängigen Analyseplattform Artificial Analysis, die neun Benchmarks aggregiert. Das entspricht GPT-5.6 Sol im maximalen Reasoning-Modus, ist ein Punkt weniger als Claude Fable 5 Max und 5 Punkte höher als Grok 4.5 von vor einem Monat. Analysten sagen, dass SpaceXAI an die Spitze der Intelligenz zurückgekehrt ist, nur Anthropic liegt vorn. Bei detaillierten Benchmarks führt Grok 4.6 bei GDPVal-AA v2 für Bürowissensarbeit mit 1753 Punkten gegenüber 1741 für Fable 5 und 1728 für Sol, und bei AA-Briefcase mit 1577 gegenüber 1574 und 1502. Außerdem führt es im juristischen Harvey LAB mit 15,8 Prozent gegenüber 11,3 Prozent für Fable 5 und 2,5 Prozent für Sol. Allerdings hinkt es deutlich hinterher bei Terminal-Bench v3.0: 26 Prozent gegenüber 34,6 Prozent für Sol und 34,1 Prozent für Fable 5, aber bei der älteren Version v2.1 erreicht es 88,4 Prozent, nur übertroffen von Claude Opus 5. Es verliert auch bei einigen Codierungs-Benchmarks: Bei DeepSWE liegt es hinter Sol (73 Prozent) und Fable 5 (70 Prozent), und bei FrontierCode und APEX-SWE verliert es gegen Fable 5. Der interessanteste Aspekt ist, wie die Parität erreicht wurde: Laut Musk basiert Grok 4.6 auf derselben Basis mit 1,5 Billionen Parametern wie Grok 4.5, das Modell ist also nicht gewachsen. Statt Skalierung führte das Unternehmen einen weiteren, längeren Trainingszyklus auf derselben Basis mit kuratierten synthetischen Daten zu Reasoning- und Engineering-Themen und einem verbesserten Optimierer durch, dann wurden die SFT- und RL-Phasen neu aufgebaut. SFT-Trajektorien wurden von Grok 4.5 selbst neu generiert, wobei problematische Beispiele durch Modellchecks herausgefiltert wurden – effektiv trainierte die vorherige Version die nächste. In Cursor, das jetzt zu SpaceXAI gehört, wird angemerkt, dass Grok 4.6 die Struktur und visuelle Sprache einer App aus dem ersten Entwurf basierend auf einer Ideenbeschreibung aufbaut, und bei langen Trajektorien zeigt es deutlich mehr Selbstkontrolle: Es testet seine eigene Arbeit, bevor es weitermacht. Die RL-Aufgaben während des Trainings reichten von der Optimierung von Computerkernen bis hin zu Webentwicklung und CAD. Die Wirtschaftlichkeit bleibt von Grok 4.5, veröffentlicht am 8. Juli: dieselben 2/6 Dollar, was laut Artificial Analysis über 60 Prozent niedriger ist als bei Claude Opus 5 (5/25 Dollar) und GPT-5.6 Sol (5/30 Dollar). Die Kosten für eine Intelligence-Index-Aufgabe betragen für das Modell 0,84 Dollar, wie bei Kimi K3, aber mit etwas mehr Intelligenz, was es genau auf der Pareto-Frontlinie von Intelligenz gegenüber Preis platziert. Seine charakteristische Token-Effizienz bleibt bestehen: Bei AA-Briefcase erledigt Grok 4.6 eine lange agentische Aufgabe durchschnittlich in 53 Schritten und einer halben Milliarde Eingabe-Token, gegenüber 103 Schritten und zwei Milliarden bei Claude Opus 5. Nur die Cache-Treffer sind gestiegen, von 0,3 auf 0,5 Dollar pro Million. SpaceXAI hat ein hohes Veröffentlichungstempo: Grok 4.5 debütierte am 8. Juli, Grok 4.6 am 12. August, und Grok 4.7 mit 2,1 Billionen Parametern, den Musk im August-Anruf auf drei bis vier Wochen entfernt schätzte, also bis Ende des Sommers. Zusammen mit dem Kauf von Cursor und dem früher gestarteten Grok Bot Agenten verwandelt sich Grok von einem Meme in eine Produktlinie mit eigener Entwicklungsumgebung, Agent und Modell-Pipeline.
Quelle: Habr — хаб ML —
Original
