ModelBisnis & Pasar 🇷🇺 14.08.2026 09:03

Grok 4.6 Dirilis: Bagaimana Model Ini Menyamai Level GPT-5.6 dengan Harga Setengah

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
SpaceXAI merilis Grok 4.6, yang menurut perusahaan menyamai level model terkuat di pasar dengan harga setengah: $2 per juta token masukan dan $6 per juta token keluaran. Model ini mencetak skor 61 pada Indeks Intelijen Artificial Analysis, setara dengan GPT-5.6 Sol, dan telah tersedia di Grok Build, Cursor, Grok Bot, dan melalui API.
SpaceXAI memperkenalkan Grok 4.6, mengklaim bahwa model ini mencapai level model terkuat dengan biaya setengah dari pesaing: harga $2 per juta token input dan $6 per juta token output. Model ini sudah dapat diakses di agen Grok Build, di Cursor, di Grok Bot, dan melalui API, dengan batas penggunaan ganda untuk minggu pertama di Cursor dan Grok Build. Angka kunci adalah 61 poin pada Indeks Intelijen dari platform analitik independen Artificial Analysis, yang menggabungkan sembilan tolok ukur. Ini setara dengan GPT-5.6 Sol pada mode penalaran maksimum, satu poin lebih rendah dari Claude Fable 5 Max, dan 5 poin lebih tinggi dari Grok 4.5 sebulan sebelumnya. Analis mengatakan SpaceXAI telah kembali ke garis depan kecerdasan, dengan hanya Anthropic yang berada di depan. Pada tolok ukur terperinci, Grok 4.6 memimpin pada GDPVal-AA v2 untuk pekerjaan pengetahuan kantor dengan 1753 poin dibandingkan 1741 untuk Fable 5 dan 1728 untuk Sol, dan pada AA-Briefcase dengan 1577 dibandingkan 1574 dan 1502. Model ini juga unggul pada Harvey LAB hukum dengan 15,8% dibandingkan 11,3% untuk Fable 5 dan 2,5% untuk Sol. Namun, model ini tertinggal secara signifikan pada Terminal-Bench v3.0: 26% dibandingkan 34,6% untuk Sol dan 34,1% untuk Fable 5, tetapi pada versi v2.1 yang lebih lama, model ini mencetak 88,4%, hanya di belakang Claude Opus 5. Model ini juga kalah pada beberapa tolok ukur pengkodean: pada DeepSWE, ia tertinggal dari Sol (73%) dan Fable 5 (70%), dan pada FrontierCode dan APEX-SWE, ia kalah dari Fable 5. Aspek yang paling menarik adalah bagaimana kesetaraan dicapai: menurut Musk, Grok 4.6 dibangun di atas basis 1,5 triliun parameter yang sama dengan Grok 4.5, sehingga model tidak tumbuh. Alih-alih meningkatkan skala, perusahaan menjalankan siklus pelatihan lain yang lebih lama pada basis yang sama dengan data sintetis yang dikurasi tentang topik penalaran dan teknik serta pengoptimal yang lebih baik, kemudian membangun kembali tahap SFT dan RL. Lintasan SFT dihasilkan ulang oleh Grok 4.5 itu sendiri, menyaring contoh bermasalah dengan pemeriksaan model—efektifnya, versi sebelumnya melatih versi berikutnya. Di Cursor, yang sekarang dimiliki oleh SpaceXAI, mereka mencatat bahwa Grok 4.6 membangun struktur dan bahasa visual aplikasi dari langkah pertama berdasarkan deskripsi ide, dan pada lintasan panjang, model ini menunjukkan lebih banyak pemeriksaan diri secara signifikan: ia menguji pekerjaannya sendiri sebelum melanjutkan. Tugas RL selama pelatihan berkisar dari mengoptimalkan kernel komputasi hingga pengembangan web dan CAD. Ekonomi tetap dari Grok 4.5, dirilis 8 Juli: $2/$6 yang sama, yang menurut Artificial Analysis lebih dari 60% lebih rendah dari Claude Opus 5 ($5/$25) dan GPT-5.6 Sol ($5/$30). Biaya tugas Indeks Intelijen adalah $0,84 untuk model ini, seperti Kimi K3, tetapi dengan kecerdasan sedikit lebih tinggi, menempatkannya tepat di garis depan Pareto kecerdasan versus harga. Efisiensi token khasnya bertahan: pada AA-Briefcase, Grok 4.6 menyelesaikan tugas agen panjang dalam rata-rata 53 giliran dan setengah miliar token input, dibandingkan dengan 103 giliran dan dua miliar untuk Claude Opus 5. Hanya peningkatan cache yang naik, dari $0,3 menjadi $0,5 per juta. SpaceXAI memiliki kecepatan rilis yang kuat: Grok 4.5 debut pada 8 Juli, Grok 4.6 pada 12 Agustus, dan Grok 4.7 dengan 2,1 triliun parameter yang diperkirakan Musk pada panggilan Agustus akan hadir tiga hingga empat minggu lagi, yaitu pada akhir musim panas. Digabungkan dengan pembelian Cursor dan agen Grok Bot yang diluncurkan sebelumnya, Grok berubah dari meme menjadi lini produk dengan lingkungan pengembangan sendiri, agen, dan jalur model.
Sumber: Habr — хаб ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru