Gemini Flash 3.6:并非更聪明,但明显更便宜
Google/DeepMind
谷歌发布了三个模型:Gemini 3.6 Flash(主力)、Gemini 3.5 Flash-Lite(快速/便宜)和 Gemini 3.5 Flash Cyber(安全、受限)。主要改进是相同任务下输出 token 减少 17%,在代理场景中节省 31-71% 成本。但模型视觉解析能力下降,尤其在图表上。Gemini 3.5 Flash-Lite 是意外的性价比领导者,有时超越旧款中端模型。谷歌还宣布了 Gemini 3.5 Pro 的内部测试和 Gemini 4 预训练的开始。
7月21日,谷歌发布三款模型:Gemini 3.6 Flash(取代3.5 Flash,定价每百万输入/输出token分别为1.50美元/7.50美元)、Gemini 3.5 Flash-Lite(超高速且廉价,每百万token 0.30美元/2.50美元)以及Gemini 3.5 Flash Cyber(用于漏洞挖掘,仅限政府使用)。据Artificial Analysis分析,与3.5 Flash相比,其输出token数量减少17%,在DeepSWE编码基准测试中节省高达65%(97k token对比276k token)。整体智能指数(50分)保持不变。在基准测试中,3.6 Flash在DeepSWE(37%→49%)、MLE-Bench(49.7%→63.9%)、OSWorld-Verified(78.4%→83.0%)以及长上下文召回(约27%→54%)方面均有提升,但在纯编码(SWE-Bench Pro 58.7%对比64.7%)和知识任务(GDPval-AA Elo评分1421对比Sonnet 5的1607)上落后于Grok 4.5和Claude Sonnet 5等顶级竞争对手。一个显著的退化:LlamaIndex首席执行官Jerry Liu发现,ParseBench图表读取能力从45%下降至31%,文档评分从69.9降至66.8,这可能是后续训练专注于代码/智能体的一种权衡。Flash-Lite模型颇具性价比:输出速度达350 tok/s,在一些测试中超越了旧版Gemini 3 Flash(SWE-Bench Pro 54.2%对比49.6%,OSWorld-Verified 74.0%对比65.1%),且比Claude Haiku 4.5更便宜。Flash Cyber基于3.5 Flash构建,在Chrome V8中发现了55个独特问题(基础版为47个,Claude Opus 4.6为36个),并在CyberGym基准测试中获得83.2%的分数(在专门模型中排名第四)。谷歌还透露,已与合作伙伴内部测试Gemini 3.5 Pro,并开始Gemini 4的预训练。
来源: Habr — хаб ИИ —
原文
