ModèlesAffaires et Marché 🇷🇺 26.07.2026 15:02

Gemini Flash 3.6 : pas plus intelligent, mais nettement moins cher

Google/DeepMindGoogle/DeepMind
Google a publié trois modèles : Gemini 3.6 Flash (principal), Gemini 3.5 Flash-Lite (rapide/économique) et Gemini 3.5 Flash Cyber (sécurité, restreint). L'amélioration clé est une réduction de 17 % des jetons de sortie pour les mêmes tâches, ce qui se traduit par des économies de 31 à 71 % dans les scénarios agentiques. Cependant, l'analyse visuelle du modèle a régressé, en particulier sur les graphiques. Gemini 3.5 Flash-Lite est un leader de valeur surprise, surpassant parfois des modèles milieu de gamme plus anciens. Google a également annoncé les tests internes de Gemini 3.5 Pro et le début du pré-entraînement de Gemini 4.
Le 21 juillet, Google a publié trois modèles : Gemini 3.6 Flash (remplaçant 3.5 Flash, facturé à 1,50 $/7,50 $ par million de tokens), Gemini 3.5 Flash-Lite (ultra-rapide et économique à 0,30 $/2,50 $) et Gemini 3.5 Flash Cyber (pour la chasse aux vulnérabilités, réservé aux gouvernements). Le chiffre phare est une réduction de 17 % des tokens de sortie par rapport à 3.5 Flash selon Artificial Analysis, atteignant 65 % d'économies sur le benchmark de codage DeepSWE (97 000 tokens contre 276 000). L'indice global d'intelligence (50 points) reste inchangé. Sur les benchmarks, 3.6 Flash s'est amélioré sur DeepSWE (37 % → 49 %), MLE-Bench (49,7 % → 63,9 %), OSWorld-Verified (78,4 % → 83,0 %) et le rappel en contexte long (~27 % → 54 %), mais a accusé un retard par rapport aux meilleurs concurrents comme Grok 4.5 et Claude Sonnet 5 en codage pur (SWE-Bench Pro 58,7 % contre 64,7 %) et en tâches de connaissances (GDPval-AA Elo 1421 contre 1607 pour Sonnet 5). Une régression notable : le PDG de LlamaIndex, Jerry Liu, a constaté une baisse de la lecture de graphiques ParseBench de 45 % à 31 %, et des scores documentaires de 69,9 à 66,8, probablement un compromis dû à l'accent mis sur le code et les agents lors du post-entraînement. Le modèle Flash-Lite se démarque par son rapport qualité-prix : 350 tokens/s en sortie, surpassant l'ancien Gemini 3 Flash sur certains tests (SWE-Bench Pro 54,2 % contre 49,6 %, OSWorld-Verified 74,0 % contre 65,1 %) et moins cher que Claude Haiku 4.5. Flash Cyber, basé sur 3.5 Flash, a trouvé 55 problèmes uniques sur Chrome V8 (contre 47 pour la version de base, 36 pour Claude Opus 4.6) et a obtenu un score de 83,2 % sur le benchmark CyberGym (quatrième parmi les modèles spécialisés). Google a également noté des tests internes de Gemini 3.5 Pro avec des partenaires et le début du pré-entraînement de Gemini 4.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches