на бенчмарке кодирования DeepSWE (97 тыс. токенов против 276 тыс.). Общий индекс интеллекта (50 баллов) не изменился. По бенчмаркам 3.6 Flash улучшила показатели на DeepSWE (37%→49%), MLE-Bench (49,7%→63,9%), OSWorld-Verified (78,4%→83,0%) и долгом контексте (~27%→54%), но отстала от топовых конкурентов, таких как Grok 4.5 и Claude Sonnet 5, в чистом кодировании (SWE-Bench Pro 58,7% против 64,7%) и задачах на знания (GDPval-AA Elo 1421 против 1607 у Sonnet 5). Заметная регрессия: генеральный директор LlamaIndex Джерри Лю обнаружил, что чтение графиков в ParseBench упало с 45% до 31%, а результаты по документам — с 69,9 до 66,8, что, вероятно, является компромиссом из-за пост-тренировочной фокусировки на коде и агентах. Модель Flash-Lite — выдающаяся по соотношению цена/качество: 350 токенов/сек на выходе, превосходит старые Gemini 3 Flash в некоторых тестах (SWE-Bench Pro 54,2% против 49,6%, OSWorld-Verified 74,0% против 65,1%) и дешевле Claude Haiku 4.5. Flash Cyber, созданная на базе 3.5 Flash, нашла 55 уникальных проблем в Chrome V8 (против 47 у базовой версии и 36 у Claude Opus 4.6) и набрала 83,2% на бенчмарке CyberGym (четвёртое место среди специализированных моделей). Google также сообщила о внутреннем тестировании Gemini 3.5 Pro с партнёрами и начале предварительного обучения Gemini 4.