визуальных и текстовых токенов с ранним слиянием. Step 3.5 Flash от StepFun (196B MoE, 11B активных) достиг 100 токенов в секунду при длине контекста 128k с использованием MTP-3 (Multi-Token Prediction, третий этап). Qwen3-Coder-Next (80B, 3B активных) превзошел более крупные модели в задачах программирования благодаря гибриду Gated DeltaNet и Gated Attention (3:1). Также упоминаются GLM-5 от z.AI, MiniMax M2.5, Nanbeige 4.1 3B, Qwen 3.5, Ling 2.5 и Ring 2.5 от Ant Group, Tiny Aya от Cohere, а также модели Sarvam 30B и 105B.