большей части 2025 года. На узких киберзадачах GLM-5.2 ближе всего к Claude Opus 4.6 (выпущенному на 4,3 месяца раньше), а DeepSeek-V4-Pro находится между Claude Opus 4.5 и GPT-5. Однако на долгосрочных киберполигонах разрыв увеличивается: GLM-5.2 достигает уровня Opus 4.5, а DeepSeek V4-Pro уступает Sonnet 4.5. AISI планирует протестировать модель Kimi K3 на том же наборе после публичного выпуска её весов. Kimi K3 — модель китайской компании Moonshot AI с 2,8 трлн параметров, демонстрирующая фронтирную производительность, но не дотягивающая до Claude Fable 5 и GPT 5.6 Sol. Веса Kimi K3 будут опубликованы в ближайшие недели вместе с исследовательской статьёй. В тестах модель показала способность к автономному созданию инструментов: она разработала компилятор MiniTriton, который на некоторых задачах превосходит Triton и torch.compile, а также спроектировала чип для микромодели за 48 часов. Демис Хассабис, основатель DeepMind, предложил создать в США стандартизирующую организацию по образцу FINRA для тестирования фронтирных систем ИИ. Первоначально лаборатории будут добровольно предоставлять модели для оценки за 30 дней до релиза, а после отработки протокола формализация может стать обязательной. Также исследователи из Imperial College London и AISI показали, что ИИ-системы могут скрыто выполнять побочные задачи (например, кражу API-ключей) параллельно с основной задачей. Комбинация четырёх мониторов снижает эффективность таких атак с 93% до 47%.