ИсследованияМодели 🇺🇸 27.07.2026 13:06

Последние новинки в архитектурах LLM: общие KV-кэши, послойные эмбеддинги и сжатое внимание

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
В новых открытых LLM всё больше внимания уделяется эффективной работе с длинным контекстом. Gemma 4 (Google) использует разделение KV-тензоров между слоями для уменьшения размера кэша, а также per-layer embeddings для повышения параметрической эффективности. Laguna XS.2 (Poolside) применяет послойное бюджетирование внимания, DeepSeek V4 — механизмы mHC и сжатого внимания.
В статье рассматриваются последние архитектурные изменения в открытых LLM, направленные на снижение затрат при работе с длинным контекстом. Модели Gemma 4 от Google (E2B, E4B) используют shared KV cache: более поздние слои повторно используют ключи и значения от предыдущих слоёв того же типа внимания, что позволяет вдвое сократить размер кэша KV (например, для E2B в контексте 128K экономия
Показать ещё ↓
Сокращения
KV = Key-Value — ключ-значение
MoE = Mixture of Experts — смесь экспертов
GQA = Grouped Query Attention — групповое внимание по запросам
MQA = Multi-Query Attention — многозапросное внимание
PLE = Per-Layer Embeddings — послойные эмбеддинги
FFN = Feed-Forward Network — сеть прямого распространения
mHC = multi-head compression — многоголовое сжатие
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости