InvestigaciónModelos 🇺🇸 27.07.2026 13:06

Últimas innovaciones en arquitecturas de LLM: cachés KV compartidas, embeddings por capa y atención comprimida

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Los nuevos LLM abiertos se centran cada vez más en el procesamiento eficiente de contextos largos. Gemma 4 (de Google) utiliza el uso compartido de tensores KV entre capas para reducir el tamaño de la caché, así como embeddings por capa para mejorar la eficiencia paramétrica. Laguna XS.2 (de Poolside) emplea un presupuesto de atención por capa, y DeepSeek V4 introduce mecanismos de mHC y atención comprimida.
В статье рассматриваются последние архитектурные изменения в открытых LLM, направленные на снижение затрат при работе с длинным контекстом. Модели Gemma 4 от Google (E2B, E4B) используют shared KV cache: более поздние слои повторно используют ключи и значения от предыдущих слоёв того же типа внимания, что позволяет вдвое сократить размер кэша KV (например, для E2B в контексте 128K экономия составляет 2,7 ГБ при bfloat16). Кроме того, в вариантах E2B и E4B применяются послойные эмбеддинги (per-layer embeddings, PLE): каждый трансформерный блок получает небольшой токен-специфичный вектор из общей «упакованной» таблицы, что увеличивает ёмкость модели без пропорционального роста числа параметров в основных блоках. Модель Laguna XS.2 от Poolside реализует послойное бюджетирование внимания: из 40 слоёв только 10 имеют полное (глобальное) внимание, а остальные 30 — скользящее окно (512 токенов), что позволяет экономить ресурсы. Наконец, DeepSeek V4 использует механизмы mHC (multi-head compression) и сжатое внимание для дальнейшей оптимизации. Все эти приёмы, хотя и выглядят как небольшие доработки, существенно снижают нагрузку на память и вычисления при обработке длинных последовательностей.
Fuente: Sebastian Raschka — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas