Gemini Flash 3.6: Tidak Lebih Pintar, Tapi Jauh Lebih Murah
Google/DeepMind
Google merilis tiga model: Gemini 3.6 Flash (utama), Gemini 3.5 Flash-Lite (cepat/murah), dan Gemini 3.5 Flash Cyber (keamanan, terbatas). Peningkatan utamanya adalah pengurangan 17% token output untuk tugas yang sama, menghasilkan penghematan biaya 31-71% dalam skenario agen. Namun, kemampuan parsing visual model menurun, terutama pada bagan. Gemini 3.5 Flash-Lite adalah pemimpin nilai yang mengejutkan, kadang mengungguli model kelas menengah lama. Google juga mengumumkan pengujian internal Gemini 3.5 Pro dan dimulainya pra-pelatihan Gemini 4.
Pada 21 Juli, Google merilis tiga model: Gemini 3.6 Flash (menggantikan 3.5 Flash, dengan harga $1,50/$7,50 per juta token), Gemini 3.5 Flash-Lite (sangat cepat dan murah, $0,30/$2,50), dan Gemini 3.5 Flash Cyber (untuk perburuan kerentanan, khusus pemerintah). Angka utama adalah pengurangan 17% dalam output token dibandingkan dengan 3.5 Flash menurut Artificial Analysis, mencapai penghematan 65% pada tolok ukur pengkodean DeepSWE (97 ribu token vs 276 ribu). Indeks kecerdasan secara keseluruhan (50 poin) tidak berubah. Pada tolok ukur, 3.6 Flash meningkat pada DeepSWE (37%→49%), MLE-Bench (49,7%→63,9%), OSWorld-Verified (78,4%→83,0%), dan pengingatan konteks panjang (~27%→54%), namun tertinggal dari pesaing teratas seperti Grok 4.5 dan Claude Sonnet 5 dalam pengkodean murni (SWE-Bench Pro 58,7% vs 64,7%) dan tugas pengetahuan (Elo GDPval-AA 1421 vs 1607 untuk Sonnet 5). Regresi yang mencolok: CEO LlamaIndex, Jerry Liu, menemukan pembacaan grafik ParseBench turun dari 45% menjadi 31%, dan skor dokumen dari 69,9 menjadi 66,8, kemungkinan akibat trade-off dari pasca-pelatihan yang fokus pada kode/agen. Model Flash-Lite menjadi nilai unggulan: output 350 tok/dtk, mengalahkan Gemini 3 Flash yang lebih lama pada beberapa tes (SWE-Bench Pro 54,2% vs 49,6%, OSWorld-Verified 74,0% vs 65,1%) dan lebih murah daripada Claude Haiku 4.5. Flash Cyber, yang dibangun di atas 3.5 Flash, menemukan 55 masalah unik pada Chrome V8 (vs 47 untuk model dasar, 36 untuk Claude Opus 4.6) dan mencetak 83,2% pada tolok ukur CyberGym (keempat di antara model khusus). Google juga mencatat pengujian internal Gemini 3.5 Pro dengan mitra dan dimulainya prapelatihan Gemini 4.
Sumber: Habr — хаб ИИ —
asli
