направлений: масштабируемый надзор, теория обучения, эвристические аргументы, теория игр и персоны. Cognition, создатель Devin, представила бенчмарк FrontierCode из 150 задач по написанию кода, разделённых на три уровня сложности. Лучший результат на уровне Diamond показал Claude Opus 4.8 — 13.4%, что подтверждает сложность бенчмарка. На китайском рынке Xiaomi анонсировала модель MiMo-V2.5-Pro-UltraSpeed с 1 трлн параметров и скоростью генерации 1000 токенов/с за счёт совместной оптимизации архитектуры и софта, включая FP4-квантование и спекулятивное декодирование DFlash. Исследователи из нескольких университетов создали ChinaHeritaQA — мультимодальный бенчмарк из 2279 изображений 51 объекта Всемирного наследия ЮНЕСКО в Китае и 14 133 вопросов. Лучшая открытая модель Qwen-VL-8B-Instruct показала 81% точности, превзойдя человеческие 67%. Кроме того, исследователи из Сианьского университета Цзяотун и Университета Сяньдянь разработали бенчмарки AARR, оценивающие способность ИИ-агентов выполнять задачи, типичные для научного стажёра; лучшим агентом стал Claude-Opus-4.7 с Mini-Swe-Age.