Последние новинки в архитектурах LLM: общие KV-кэши, послойные эмбеддинги и сжатое внимание
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
В новых открытых LLM всё больше внимания уделяется эффективной работе с длинным контекстом. Gemma 4 (Google) использует разделение KV-тензоров между слоями для уменьшения размера кэша, а также per-layer embeddings для повышения параметрической эффективности. Laguna XS.2 (Poolside) применяет послойное бюджетирование внимания, DeepSeek V4 — механизмы mHC и сжатого внимания.
В статье рассматриваются последние архитектурные изменения в открытых LLM, направленные на снижение затрат при работе с длинным контекстом. Модели Gemma 4 от Google (E2B, E4B) используют shared KV cache: более поздние слои повторно используют ключи и значения от предыдущих слоёв того же типа внимания, что позволяет вдвое сократить размер кэша KV (например, для E2B в контексте 128K экономия
Показать ещё ↓
- Сокращения
- KV = Key-Value — ключ-значение
- MoE = Mixture of Experts — смесь экспертов
- GQA = Grouped Query Attention — групповое внимание по запросам
- MQA = Multi-Query Attention — многозапросное внимание
- PLE = Per-Layer Embeddings — послойные эмбеддинги
- FFN = Feed-Forward Network — сеть прямого распространения
- mHC = multi-head compression — многоголовое сжатие
Источник: Sebastian Raschka —
оригинал
