研究模型 🇺🇸 27.07.2026 13:06

LLM架构最新创新:共享KV缓存、逐层嵌入和压缩注意力

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
新的开源大语言模型越来越注重高效的长上下文处理。Gemma 4(谷歌)在层间共享KV张量以减少缓存大小,并采用逐层嵌入提高参数效率。Laguna XS.2(Poolside)使用逐层注意力预算分配,DeepSeek V4引入了mHC和压缩注意力机制。
本文探讨了开放大语言模型(LLM)在架构方面的最新变化,旨在降低长上下文处理成本。谷歌的 Gemma 4 模型(E2B、E4B)采用了共享键值(KV)缓存:较晚的层会复用同类型注意力机制中较早层的键和值,从而将 KV 缓存大小减半(例如,在 bfloat16 精度下,E2B 在 128K 上下文中的缓存节省量可达 2.7 GB)。此外,E2B 和 E4B 变体还引入了逐层嵌入(PLE):每个变换器块都从共享的“打包”表中获取一个小的令牌特定向量,从而在不按比例增加主块参数数量的情况下提高了模型容量。Poolside 公司的 Laguna XS.2 模型采用逐层注意力预算分配:在 40 个层中,只有 10 个层具有全局注意力,其余 30 个层则采用滑动窗口注意力(窗口大小为 512 个令牌),以此来节省资源。最后,DeepSeek V4 利用多头压缩(mHC)和压缩注意力机制进一步优化。尽管这些技术看起来像是小修小补,但它们显著降低了处理长序列时的内存和计算负担。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻