Grok 4.6 Dirilis: AI Agenik yang Ditingkatkan, Benchmark Lebih Baik, Tersedia di Cursor dan Grok Build
xAI
xAI telah merilis Grok 4.6, versi terbaru dari model AI mereka yang berfokus pada agen berdurasi panjang dan tugas interaktif serta visual yang kompleks. Model ini menunjukkan kinerja kompetitif pada beberapa benchmark, terkadang menyamai atau melampaui GPT-5.6 Sol dan Fable 5. Grok 4.6 tersedia di Cursor dan Grok Build, dengan akses API dan platform mitra.
xAI telah meluncurkan Grok 4.6, yang dibangun di atas Grok 4.5 dengan kemampuan yang ditingkatkan untuk tugas-tugas agen berdurasi panjang, penanganan yang lebih baik untuk proses multi-langkah yang kompleks termasuk penelitian, pengodean, dan mengubah ide menjadi aplikasi yang dipoles. Model ini dilatih dengan fase tambahan pelatihan lanjutan menggunakan data yang dihasilkan model yang dipilih secara cermat, pengoptimal yang ditingkatkan, dan metodologi yang diperbarui, diikuti dengan fase SFT dan RL. Model ini menunjukkan kemampuan dalam pemeriksaan diri dan verifikasi, serta unggul dalam mengubah ide produk menjadi prototipe yang berfungsi, terutama dalam proyek visual dan interaktif. Mekanisme keamanan ditingkatkan dan dikalibrasi, dengan model menjalani pengujian paling ekstensif dalam sejarah xAI. Hasil tolok ukur menunjukkan Grok 4.6 High mencapai Indeks Kecerdasan Buatan (AA) 61, GDPVal-AA v2 1753, CursorBench v3.2 69,9%, DeepSWE v1.1 65,9%, FrontierCode v1.1 (Diperpanjang) 61,3%, APEX-Agents 57,5%, Terminal-Bench v3.0 26%, APEX-SWE 56,4%, AA-Briefcase 1577, dan Harvey LAB (Vals) 15,8%. Grok 4.6 kini tersedia di Cursor dan Grok Build, serta melalui API dan di platform mitra termasuk OpenRouter, Vercel, dan Cloudflare. Harga mulai dari $2 per juta token input dan $6 per juta token output, dengan versi lebih cepat berharga dua kali lipat. Selama minggu pertama, penggunaan yang disertakan di Grok Build dan Cursor digandakan.
Sumber: Habr — хаб ИИ —
asli
