LLM架构最新创新:共享KV缓存、逐层嵌入和压缩注意力
新的开源大语言模型越来越注重高效的长上下文处理。Gemma 4(谷歌)在层间共享KV张量以减少缓存大小,并采用逐层嵌入提高参数效率。Laguna XS.2(Poolside)使用逐层注意力预算分配,DeepSeek V4引入了mHC和压缩注意力机制。
Google/DeepMind
Poolside
DeepSeek
Technology Innovation Institute
Sebastian Raschka27.07 · 13:06





