Gemini Flash 3.6: não mais inteligente, mas visivelmente mais barato
Google/DeepMind
A Google lançou três modelos: Gemini 3.6 Flash (principal), Gemini 3.5 Flash-Lite (rápido/barato) e Gemini 3.5 Flash Cyber (segurança, restrito). A principal melhoria é uma redução de 17% nos tokens de saída para as mesmas tarefas, resultando em economia de 31-71% em cenários agentivos. No entanto, a interpretação visual do modelo regrediu, especialmente em gráficos. Gemini 3.5 Flash-Lite é uma surpresa como líder de valor, às vezes superando modelos antigos de médio porte. A Google também anunciou testes internos do Gemini 3.5 Pro e o início do pré-treinamento do Gemini 4.
Em 21 de julho, a Google lançou três modelos: Gemini 3.6 Flash (substituindo o 3.5 Flash, com preço de $1,50/$7,50 por milhão de tokens), Gemini 3.5 Flash-Lite (ultrarrápido e barato, a $0,30/$2,50) e Gemini 3.5 Flash Cyber (para caça de vulnerabilidades, exclusivo para governos). O destaque é uma redução de 17% nos tokens de saída em comparação com o 3.5 Flash, segundo a Artificial Analysis, alcançando 65% de economia no benchmark de codificação DeepSWE (97 mil tokens contra 276 mil). O índice geral de inteligência (50 pontos) permanece inalterado. Em benchmarks, o 3.6 Flash melhorou no DeepSWE (37%→49%), MLE-Bench (49,7%→63,9%), OSWorld-Verified (78,4%→83,0%) e recall de contexto longo (~27%→54%), mas ficou atrás dos principais concorrentes como Grok 4.5 e Claude Sonnet 5 em codificação pura (SWE-Bench Pro 58,7% vs 64,7%) e tarefas de conhecimento (GDPval-AA Elo 1421 vs 1607 para Sonnet 5). Uma regressão notável: Jerry Liu, CEO da LlamaIndex, descobriu que a leitura de gráficos do ParseBench caiu de 45% para 31%, e as pontuações de documentos de 69,9 para 66,8, provavelmente um trade-off decorrente do foco do pós-treinamento em código/agentes. O modelo Flash-Lite é um destaque em custo-benefício: saída de 350 tokens por segundo, superando o antigo Gemini 3 Flash em alguns testes (SWE-Bench Pro 54,2% vs 49,6%, OSWorld-Verified 74,0% vs 65,1%) e mais barato que o Claude Haiku 4.5. O Flash Cyber, construído sobre o 3.5 Flash, encontrou 55 problemas únicos no Chrome V8 (contra 47 do modelo base, 36 do Claude Opus 4.6) e obteve 83,2% no benchmark CyberGym (quarto entre modelos especializados). A Google também mencionou testes internos do Gemini 3.5 Pro com parceiros e o início do pré-treinamento do Gemini 4.
Fonte: Habr — хаб ИИ —
original
