⚡ 突发新闻
研究模型 🇺🇸 27.07.2026 13:06

LLM架构创新:KV共享、逐层嵌入与压缩注意力

Google/DeepMindGoogle/DeepMind PoolsidePoolside DeepSeekDeepSeek Technology Innovation InstituteTechnology Innovation Institute
Sebastian Raschka回顾了近期开源权重LLM架构的进展,重点关注长上下文效率。关键技术包括跨层KV共享(Gemma 4)、逐层嵌入(Gemma 4 E2B/E4B)、逐层注意力预算(Laguna XS.2)、压缩卷积注意力(ZAYA1),以及带有压缩注意力的mHC(DeepSeek V4)。这些技术减少了KV缓存大小和内存流量,适用于推理和智能体工作流。
塞巴斯蒂安·拉什卡(Sebastian Raschka)调研了近期开源大语言模型的架构变化,这些变化旨在降低长上下文成本。在Gemma 4 E2B/E4B中,后面的层会复用前面层的键值状态(跨层注意力),从而节省约一半的KV缓存大小(例如在128K上下文下节省2.7 GB)。此外,这些模型使用逐层嵌入(per-layer embedding, PLE)来增加容量,而不扩展主Transformer堆栈——“有效”参数数量小于包含嵌入的总参数数量。Poolside开发的Laguna XS.2模型按层区分注意力成本,其中30层使用滑动窗口注意力(窗口大小为512),10层使用全注意力。ZAYA1-8B引入了压缩卷积注意力(compressed convolutional attention),而DeepSeek V4则采用了混合压缩(mHC)和压缩注意力。这些改进的动机在于推理模型和智能体工作流中对高效长上下文处理的需求日益增长。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻