模型研究 🇺🇸 27.07.2026 18:04

大型语言模型架构对比:从DeepSeek V3到OLMo 2

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
Sebastian Raschka对比了现代大语言模型的架构,包括采用多头潜在注意力和混合专家模型的DeepSeek V3,以及来自艾伦人工智能研究所、使用后归一化和QK归一化的OLMo 2。文章涵盖了分组查询注意力等各种归一化方案等关键架构决策。
在文章中,Sebastian Raschka 研究了现代大型语言模型的架构特征,比较了 DeepSeek V3/R1、OLMo 2 等模型。DeepSeek V3 采用了多头潜在注意力(MLA),通过将键和值压缩到低维空间来节省 KV 缓存内存,并使用了包含 256 个专家的混合专家模型(MoE),其中只有 9 个专家处于激活状态(一个共享专家和 8 个由路由器选择的专家),这使得它在拥有 6710 亿总参数的情况下,每一步仅使用 370 亿参数。而艾伦人工智能研究所的 OLMo 2 则采用了传统的多头注意力机制,但使用了后归一化(在注意力和前馈网络层之后使用 RMSNorm)以及 QK 归一化来稳定训练。文章还提到了其他模型中使用的分组查询注意力作为多头注意力机制的替代方案。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻