研究模型 🇺🇸 27.07.2026 18:04

DeepSeek-V3 技术报告新出炉:软硬件协同设计如何实现低成本大模型训练

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
DeepSeek-V3 团队发布了一份新的 14 页技术报告,由 DeepSeek 首席执行官梁文锋共同撰写。该文档分析了大语言模型的扩展挑战及硬件基础设施的作用,并提出了基于模型与硬件联合设计的解决方案,以实现低成本的训练和推理。
DeepSeek-V3团队发布了一份新的技术报告,公司首席执行官梁文锋被列为合著者。这份14页的报告聚焦于大型语言模型(LLM,即Large Language Model)的扩展问题以及硬件限制的反映。与之前描述V3架构的论文不同,新报告侧重于模型开发与其硬件之间的关系。DeepSeek-V3在由2048块NVIDIA H800 GPU组成的集群上进行训练,它展示了如何利用硬件特性来克服瓶颈——内存不足、计算效率和互连带宽的问题。关键架构决策之一是多头潜在注意力(MLA,即Multi-head Latent Attention)机制,它将键值缓存压缩到每个token 70KB(相比之下,LLaMA-3.1 405B为516KB,Qwen-2.5 72B为327KB)。计算效率的提升得益于DeepSeekMoE的稀疏架构:拥有6710亿参数的模型每个token仅激活370亿参数,每个token需要约250 GFLOPS,而Qwen-2.5 72B为394 GFLOPS,LLaMA-3.1 405B为2448 GFLOPS。为了加速推理,采用了双微批量架构,将通信与计算重叠,并分为预填充和解码阶段。DeepSeek-V3是首个公开已知的使用FP8混合精度训练的大模型,从而降低了计算成本。对于节点间通信,数据通过FP8(对数浮点矩阵转置)压缩,将通信量减半。由于监管限制,NVIDIA H800的NVLink带宽减半(400 GB/s vs 900),因此DeepSeek应用了“节点导向”的MoE专家路由,将专家分组为8组,每组32个专家在同一节点上,并将每个token的接收节点数限制为四个。报告还讨论了未来方向:将单机扩展和集群扩展合并为统一总线(UB,即Unified Bus),引入专用协处理器处理网络流量,动态管理NVLink/PCIe带宽,以及使用多平面胖树拓扑。
来源: Synced — 原文
我们之前关于此话题的帖子 ↓
最新新闻