⚡ 突发新闻
模型研究 🇺🇸 27.07.2026 17:03

从DeepSeek V3到V3.2:架构、稀疏注意力与强化学习更新

DeepSeekDeepSeek
DeepSeek发布了V3.2,这是一款开放权重的旗舰模型,性能可与GPT-5和Gemini 3.0 Pro相媲美。该模型引入了DeepSeek稀疏注意力(DSA)以提高效率,并从专用推理模型(R1)演进为混合推理模型(V3.1、V3.2)。时间线包括V3、R1、R1-0528、V3.1、V3.2-Exp和V3.2,架构亮点包括多头潜在注意力(MLA)和RLVR训练。
DeepSeek V3.2 在美国假日周末发布,其性能媲美 GPT-5 和 Gemini 3.0 Pro,且为开源权重模型。它基于 V3.1 构建,后者在 V3 基础上引入了混合推理(指令模式和推理模式)。关键新功能是 DeepSeek 稀疏注意力(DeepSeek Sparse Attention,DSA),这是一种包含闪电索引器和令牌选择器的学习型稀疏注意力机制,可提升效率,尤其是在长上下文场景中。DSA 通过动态选择要关注的过去令牌,取代了滑动窗口注意力。V3.2-Exp(2025 年 9 月)是一次实验性发布,旨在为 V3.2 准备基础设施。早期模型包括:V3(2024 年 12 月)采用混合专家模型(Mixture of Experts,MoE)和多头潜在注意力(Multi-head Latent Attention,MLA);R1(2025 年 1 月)通过基于群体相对策略优化(Group Relative Policy Optimization,GRPO)的强化学习与验证推理(Reinforcement Learning with Verifiable Reasoning,RLVR)增加了推理能力;R1-0528 是小型升级。据报道,该公司曾从英伟达(NVIDIA)芯片转向华为芯片,后又转回英伟达。V3.2 发布旨在打造一款多功能混合模型,而专用的 R2 可能仍在开发中。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻