Grok 4.6 Yayınlandı: Model Yarı Fiyata GPT-5.6 Seviyesine Nasıl Ulaştı
Anthropic
OpenAI
Moonshot AI
SpaceXAI, Grok 4.6'yı yayınladı; şirkete göre bu model, milyon giriş tokeni başına 2 dolar ve milyon çıkış tokeni başına 6 dolar ile pazardaki en güçlü modellerin seviyesine yarı fiyatla ulaşıyor. Model, Artificial Analysis'in Zeka Endeksi'nde GPT-5.6 Sol ile eşit olan 61 puan alıyor ve Grok Build, Cursor, Grok Bot ve API üzerinden kullanıma sunuldu.
SpaceXAI, Grok 4.6'yı tanıttı ve rakiplerin maliyetinin yarısına en güçlü modellerin seviyesine ulaştığını iddia ediyor: fiyatlandırma, milyon giriş tokeni başına 2 dolar ve milyon çıkış tokeni başına 6 dolar. Model, Grok Build aracısında, Cursor'da, Grok Bot'ta ve API üzerinden zaten erişilebilir durumda; Cursor ve Grok Build'da ilk hafta için kullanım limitleri iki katına çıkarıldı. Kilit rakam, bağımsız analiz platformu Artificial Analysis'ın dokuz kıstası birleştiren Zeka Endeksi'nde 61 puan. Bu, maksimum akıl yürütme modundaki GPT-5.6 Sol ile eşit, Claude Fable 5 Max'ten bir puan düşük ve bir ay önceki Grok 4.5'ten 5 puan yüksek. Analistler, SpaceXAI'nin zeka sınırına geri döndüğünü ve önünde yalnızca Anthropic'in olduğunu söylüyor. Detaylı kıyaslamalarda Grok 4.6, ofis bilgi çalışması için GDPVal-AA v2'de 1753 puanla lider (Fable 5: 1741, Sol: 1728) ve AA-Briefcase'te 1577 puanla (Fable 5: 1574, Sol: 1502) önde. Ayrıca hukuk Harvey LAB'de %15,8 ile zirvede (Fable 5: %11,3, Sol: %2,5). Ancak Terminal-Bench v3.0'da belirgin şekilde geride: %26'ya karşılık Sol %34,6 ve Fable 5 %34,1; ancak eski v2.1 sürümünde %88,4 ile yalnızca Claude Opus 5'in ardından ikinci. Bazı kodlama kıyaslamalarında da kaybediyor: DeepSWE'de Sol (%73) ve Fable 5'in (%70) gerisinde; FrontierCode ve APEX-SWE'de Fable 5'e yeniliyor. En ilginç kısım, eşitliğin nasıl sağlandığı: Musk'a göre Grok 4.6, Grok 4.5 ile aynı 1,5 trilyon parametreli taban üzerine inşa edildi, yani model büyümedi. Ölçeklendirme yerine şirket, aynı taban üzerinde akıl yürütme ve mühendislik konularında küratörlü sentetik veriler ve geliştirilmiş bir optimize edici ile daha uzun bir eğitim döngüsü daha gerçekleştirdi, ardından SFT ve RL aşamalarını yeniden inşa etti. SFT yörüngeleri, Grok 4.5 tarafından yeniden üretildi ve sorunlu örnekler model kontrolleriyle elendi—etkili bir şekilde, önceki sürüm bir sonrakini eğitti. Artık SpaceXAI'nin sahibi olduğu Cursor'da, Grok 4.6'nın bir fikir açıklamasından ilk geçişte bir uygulamanın yapısını ve görsel dilini oluşturduğunu ve uzun yörüngelerde belirgin şekilde daha fazla öz kontrol sergilediğini belirtiyorlar: devam etmeden önce kendi işini test ediyor. Eğitim sırasındaki RL görevleri, hesaplama çekirdeklerini optimize etmekten web geliştirme ve CAD'e kadar uzanıyordu. Ekonomi, 8 Temmuz'da yayınlanan Grok 4.5'ten devam ediyor: aynı $2/$6; Artificial Analysis'a göre bu, Claude Opus 5 ($5/$25) ve GPT-5.6 Sol'dan ($5/$30) %60'ın üzerinde daha düşük. Model için Zeka Endeksi görevinin maliyeti, Kimi K3 gibi $0,84; ancak biraz daha fazla zeka ile, zeka-fiyat Pareto sınırına tam olarak yerleşiyor. Bilinen token verimliliği sürüyor: AA-Briefcase'te Grok 4.6, uzun bir aracılık görevini ortalama 53 turda ve yarım milyar girdi tokeniyle tamamlarken, Claude Opus 5 103 tur ve iki milyar token gerektiriyor. Sadece önbellek isabetleri arttı, milyon başına $0,3'ten $0,5'e. SpaceXAI'nin güçlü bir sürüm temposu var: Grok 4.5 8 Temmuz'da, Grok 4.6 12 Ağustos'ta çıktı ve Musk'ın Ağustos görüşmesinde tahmin ettiği 2,1 trilyon parametreli Grok 4.7'nin üç ila dört hafta uzakta olduğu, yani yaz sonuna kadar çıkacağı belirtildi. Cursor'un satın alınması ve daha önce başlatılan Grok Bot aracısıyla birleştiğinde, Grok bir mem'den kendi geliştirme ortamı, aracısı ve model hattına sahip bir ürün serisine dönüşüyor.
Kaynak: Habr — хаб ML —
orijinal
