モデルビジネス・市場 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6:賢くはないが、明らかに安い

Google/DeepMindGoogle/DeepMind
Googleは3つのモデルをリリースした:Gemini 3.6 Flash(メイン)、Gemini 3.5 Flash-Lite(高速/低価格)、Gemini 3.5 Flash Cyber(セキュリティ、制限あり)。主な改善点は、同じタスクに対して出力トークンが17%削減され、エージェントシナリオでは31~71%のコスト削減につながることだ。しかし、モデルの視覚解析能力は低下し、特にグラフで顕著だった。Gemini 3.5 Flash-Liteは驚きのコストパフォーマンスのリーダーであり、時には旧型の中級モデルを上回る性能を示す。Googleはまた、Gemini 3.5 Proの内部テストとGemini 4の事前学習の開始を発表した。
7月21日、Googleは3つのモデルをリリースした。Gemini 3.6 Flash(3.5 Flashを置き換え、価格は100万トークンあたり1.50ドル/7.50ドル)、Gemini 3.5 Flash-Lite(超高速かつ低価格で100万トークンあたり0.30ドル/2.50ドル)、Gemini 3.5 Flash Cyber(脆弱性ハンティング向け、政府機関限定)である。目玉となる数字は、Artificial Analysisによると3.5 Flashと比較して出力トークンが17%削減され、DeepSWEコーディングベンチマークでは97,000トークン対276,000トークンと65%の節約を達成したことだ。全体的な知能指数(50点)は変わっていない。ベンチマークでは、3.6 FlashはDeepSWE(37%→49%)、MLE-Bench(49.7%→63.9%)、OSWorld-Verified(78.4%→83.0%)、長文脈の想起(約27%→54%)で改善したが、純粋なコーディング(SWE-Bench Pro 58.7% vs 64.7%)や知識タスク(GDPval-AA Elo 1421 vs Sonnet 5の1607)では、Grok 4.5やClaude Sonnet 5といったトップクラスの競合に遅れをとった。顕著な後退として、LlamaIndexのCEOであるJerry Liuは、ParseBenchのチャート読み取りが45%から31%に低下し、ドキュメントスコアが69.9から66.8に低下したことを発見した。これはおそらく、コードやエージェントに重点を置いたトレーニング後の調整によるトレードオフである。Flash-Liteモデルは価値の面で際立っており、出力速度は350トークン/秒で、一部のテスト(SWE-Bench Pro 54.2% vs 49.6%、OSWorld-Verified 74.0% vs 65.1%)では旧Gemini 3 Flashを上回り、Claude Haiku 4.5よりも安価である。3.5 FlashをベースにしたFlash Cyberは、Chrome V8で55個のユニークな問題を発見し(ベースは47、Claude Opus 4.6は36)、CyberGymベンチマークで83.2%のスコアを達成した(専門モデル中4位)。Googleはまた、パートナーとのGemini 3.5 Proの内部テストと、Gemini 4の事前学習の開始についても言及した。
出典: Habr — хаб ИИ — 原文
関連記事 ↓
新着ニュース