Gemini Flash 3.6: Daha Akıllı Değil, Ancak Belirgin Şekilde Daha Ucuz
Google/DeepMind
Google üç model yayınladı: Gemini 3.6 Flash (ana), Gemini 3.5 Flash-Lite (hızlı/ucuz) ve Gemini 3.5 Flash Cyber (güvenlik, kısıtlı). Temel iyileştirme, aynı görevler için çıktı tokenlarında %17 azalma olup, aracı senaryolarda %31-71 arasında maliyet tasarrufu sağlıyor. Ancak modelin görsel ayrıştırması, özellikle grafiklerde geriledi. Gemini 3.5 Flash-Lite, bazen eski orta seviye modellerden daha iyi performans göstererek sürpriz bir değer lideri oldu. Google ayrıca Gemini 3.5 Pro'nun dahili testlerini ve Gemini 4 ön eğitiminin başladığını duyurdu.
21 Temmuz'da Google üç model yayınladı: Gemini 3.6 Flash (3.5 Flash'ın yerini alıyor, milyon token başına 1,50$/7,50$ fiyatlandırılmış), Gemini 3.5 Flash-Lite (süper hızlı ve ucuz, 0,30$/2,50$) ve Gemini 3.5 Flash Cyber (zafiyet avcılığı için, sadece hükümetlere yönelik). Artificial Analysis'e göre göze çarpan rakam, 3.5 Flash'a kıyasla çıktı token'larında %17 azalma, DeepSWE kodlama benchmark'ında ise %65 tasarruf sağlanması (276 bin tokene karşı 97 bin token). Genel zeka endeksi (50 puan) değişmedi. Benchmark'larda 3.6 Flash; DeepSWE (%37→%49), MLE-Bench (%49,7→%63,9), OSWorld-Verified (%78,4→%83,0) ve uzun bağlam hatırlamasında (~%27→%54) iyileşme gösterdi, ancak saf kodlama (SWE-Bench Pro %58,7'ye karşı %64,7) ve bilgi görevlerinde (GDPval-AA Elo 1421'e karşı Sonnet 5 için 1607) Grok 4.5 ve Claude Sonnet 5 gibi en iyi rakiplerinin gerisinde kaldı. Dikkate değer bir gerileme: LlamaIndex CEO'su Jerry Liu, ParseBench grafik okumanın %45'ten %31'e düştüğünü ve belge puanlarının 69,9'dan 66,8'e gerilediğini buldu; bu muhtemelen eğitim sonrası kod/ajanlara odaklanmanın bir ödünleşimi. Flash-Lite modeli, değer olarak öne çıkıyor: 350 token/saniye çıktı hızı, bazı testlerde eski Gemini 3 Flash'ı geride bırakıyor (SWE-Bench Pro %54,2'ye karşı %49,6, OSWorld-Verified %74,0'a karşı %65,1) ve Claude Haiku 4.5'ten daha ucuz. Flash Cyber, 3.5 Flash üzerine inşa edilmiş olup Chrome V8'de 55 benzersiz sorun buldu (tabana kıyasla 47, Claude Opus 4.6'ya kıyasla 36) ve CyberGym benchmark'ında %83,2 puan aldı (uzman modeller arasında dördüncü). Google ayrıca, ortaklarla Gemini 3.5 Pro'nun dahili testlerine ve Gemini 4 ön eğitiminin başladığını duyurdu.
Kaynak: Habr — хаб ИИ —
orijinal
