повторных вычислений. Linear Attention (линейное внимание) применяет карты признаков (например, ELU+1) к q и k, сжимая векторы KV в матрицу состояния фиксированного размера. DeltaNet расширяет Linear Attention с помощью дельта-правила для выборочного обновления памяти, уменьшая интерференцию информации. Gated DeltaNet (вентильный DeltaNet) объединяет стробирование Mamba с дельта-правилом, добавляя параметр затухания α. Kimi Linear улучшает Gated DeltaNet с помощью мелкозернистого поканального стробирования. Языковая основа Kimi K3 имеет 23 макроцикла, каждый из которых содержит три слоя Kimi Delta Attention и один слой Multi-Head Latent Attention (многоголового латентного внимания). В первом слое используется плотный FFN, а во всех остальных — Latent MoE (латентный ансамбль экспертов). Всего у Kimi K3 898 экспертов; два общих эксперта обрабатывают каждый токен, а маршрутизатор выбирает 16 экспертов на токен из оставшихся 896.