Grok 4.6 julkaistiin: malli yltää GPT-5.6-tasolle puolella hinnasta
Anthropic
OpenAI
Moonshot AI
SpaceXAI julkaisi Grok 4.6:n, joka yltää yrityksen mukaan markkinoiden tehokkaimpien mallien tasolle puolella hinnasta: 2 dollaria miljoonalta syöttötunnukselta ja 6 dollaria miljoonalta tulostunnukselta. Malli saa Artificial Analysis -indeksissä pisteet 61, mikä vastaa GPT-5.6 Solia, ja se on jo saatavilla Grok Buildissa, Cursorissa, Grok Botissa ja API:n kautta.
SpaceXAI esitteli Grok 4.6:n väittäen sen yltävän vahvimpien mallien tasolle puolella kilpailijoiden kustannuksista: hinta on 2 dollaria miljoonalta syöttötoksenilta ja 6 dollaria miljoonalta tulostoksenilta. Malli on jo saatavilla Grok Build -agentissa, Cursorissa, Grok Botissa ja API:n kautta, ja ensimmäisen viikon aikana Cursorissa ja Grok Buildissa käyttörajat ovat kaksinkertaiset. Keskeinen luku on 61 pistettä riippumattoman analytiikka-alusta Artificial Analysisin Intelligence Indexissä, joka yhdistää yhdeksän vertailuarvoa. Tämä vastaa GPT-5.6 Solia maksimipäättelytilassa, on pisteen vähemmän kuin Claude Fable 5 Max ja 5 pistettä enemmän kuin kuukautta aiempi Grok 4.5. Analyytikot sanovat SpaceXAI:n palanneen älykkyyden kärkitasolle, ja vain Anthropic on edellä. Yksityiskohtaisissa vertailuissa Grok 4.6 johtaa GDPVal-AA v2:ssa toimistotietotyössä 1753 pisteellä verrattuna Fable 5:n 1741:een ja Solin 1728:aan, sekä AA-Briefcasessa 1577 pisteellä verrattuna 1574:ään ja 1502:een. Se on myös paras juridisessa Harvey LAB -testissä 15,8 prosentin tuloksella verrattuna Fable 5:n 11,3 prosenttiin ja Solin 2,5 prosenttiin. Se jää kuitenkin selvästi jälkeen Terminal-Bench v3.0:ssa: 26 prosenttia verrattuna Solin 34,6 prosenttiin ja Fable 5:n 34,1 prosenttiin, mutta vanhemmassa v2.1-versiossa se saa 88,4 prosenttia, jääden vain Claude Opus 5:n taakse. Se häviää myös joissakin koodausvertailuissa: DeepSWE:ssä se jää Solin (73 prosenttia) ja Fable 5:n (70 prosenttia) taakse, ja FrontierCodessa sekä APEX-SWE:ssä se häviää Fable 5:lle. Mielenkiintoisin asia on, miten pariteetti saavutettiin: Muskin mukaan Grok 4.6 on rakennettu samalle 1,5 biljoonan parametrin pohjalle kuin Grok 4.5, joten malli ei kasvanut. Skaalaamisen sijaan yritys ajoi toisen, pidemmän harjoitusjakson samalla pohjalla käyttäen kuratoitua synteettistä dataa päättely- ja insinööriaiheista sekä parannettua optimoijaa, ja rakensi sitten SFT- ja RL-vaiheet uudelleen. SFT-polku regeneroi Grok 4.5 itse, suodattaen ongelmalliset esimerkit mallitarkistuksilla – käytännössä edellinen versio koulutti seuraavan. Cursorissa, joka on nyt SpaceXAI:n omistuksessa, huomautetaan, että Grok 4.6 rakentaa sovelluksen rakenteen ja visuaalisen kielen ensimmäisellä yrityksellä idean kuvauksen perusteella, ja pitkissä poluissa se osoittaa huomattavasti enemmän itsetarkistusta: se testaa omaa työtään ennen kuin jatkaa. RL-tehtävät harjoituksen aikana vaihtelivat laskennallisten ytimien optimoinnista verkkokehitykseen ja CAD:hen. Talous on ennallaan Grok 4.5:stä, joka julkaistiin 8. heinäkuuta: sama 2/6 dollaria, joka Artificial Analysisin mukaan on yli 60 prosenttia halvempi kuin Claude Opus 5 (5/25 dollaria) ja GPT-5.6 Sol (5/30 dollaria). Intelligence Index -tehtävä maksaa mallille 0,84 dollaria, kuten Kimi K3:lle, mutta hieman enemmän älykkyyttä, mikä asettaa sen tarkalleen älykkyyden ja hinnan Pareto-rajalle. Sen tunnusomainen token-tehokkuus säilyy: AA-Briefcasessa Grok 4.6 suorittaa pitkän agenttitehtävän keskimäärin 53 kierroksella ja puolella miljardilla syöttötoksenilla, kun taas Claude Opus 5 tarvitsee 103 kierrosta ja kaksi miljardia. Vain välimuistin osumien hinta nousi 0,3 dollarista 0,5 dollariin miljoonalta. SpaceXAI:lla on vahva julkaisutahti: Grok 4.5 debytoi 8. heinäkuuta, Grok 4.6 12. elokuuta, ja Grok 4.7 2,1 biljoonalla parametrilla, jonka Musk arvioi elokuun puhelussa olevan kolmen tai neljän viikon päässä, eli loppukesään mennessä. Yhdistettynä Cursoin ostoon ja aiemmin julkaistuun Grok Bot -agenttiin, Grok on muuttumassa meemistä tuotelinjaksi, jolla on oma kehitysympäristö, agentti ja malliputki.
Lähde: Habr — хаб ML —
Alkuperäinen
