Nghiên cứuPhần cứng & Suy luận 🇺🇸 27.07.2026 18:04

Báo cáo kỹ thuật mới về DeepSeek-V3: thiết kế đồng bộ phần cứng-phần mềm giúp giảm chi phí huấn luyện mô hình lớn

DeepSeekDeepSeek NVIDIANVIDIA Alibaba/QwenAlibaba/Qwen MetaMeta
Một bài báo kỹ thuật mới từ nhóm DeepSeek, với CEO Wenfeng Liang là đồng tác giả, khám phá thiết kế đồng bộ mô hình nhận biết phần cứng để giảm chi phí huấn luyện LLM. Sử dụng DeepSeek-V3 được huấn luyện trên 2048 GPU NVIDIA H800 làm nghiên cứu điển hình, bài báo trình bày chi tiết các cải tiến về hiệu quả bộ nhớ (MLA), tính toán thưa (DeepSeekMoE), huấn luyện FP8 và định tuyến nhận biết kết nối.
这篇14页的论文《AI架构硬件的扩展挑战与反思》分析了硬件限制(内存、计算、互连带宽)如何影响LLM的设计。DeepSeek-V3采用多头潜在注意力(MLA)将KV缓存压缩至每个token 70 KB,而LLaMA-3.1 405B为516 KB。其DeepSeekMoE架构每个token只激活671B参数中的37B,将每个token的FLOPs降至约250 GFLOPS,而Qwen2.5-72B为394,LLaMA-3.1 405B为2448。该模型采用FP8混合精度训练和LogFMT低精度通信,与BF16相比通信量减少50%。为缓解NVIDIA H800降低的NVLink带宽(400 GB/s,而H100为900 GB/s),节点感知路由将256个专家分组为8个节点本地组,每个token最多限制访问4个节点。论文提倡统一的扩展规模/扩展输出互连和专用的通信协处理器。
Nguồn: Synced — bản gốc
Bài viết liên quan trước đây ↓
Tin mới