Последние новинки в архитектурах LLM: общие KV-кэши, послойные эмбеддинги и сжатое внимание
В новых открытых LLM всё больше внимания уделяется эффективной работе с длинным контекстом. Gemma 4 (Google) использует разделение KV-тензоров между слоями для уменьшения размера кэша, а также per-layer embeddings для повышения параметрической эффективности. Laguna XS.2 (Poolside) применяет послойное бюджетирование внимания, DeepSeek V4 — механизмы mHC и сжатого внимания.
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka27.07 · 13:06
