2025年大语言模型现状:进展、挑战与预测
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
2025年,大语言模型的发展以使用可验证奖励的强化学习(RLVR)和GRPO算法的推理模型为主导,这一趋势由DeepSeek R1引发。关键趋势包括关注推理时扩展、混合专家(MoE)架构以及效率优化技巧(如Gated DeltaNets)。学术研究突出了GRPO变体在零梯度过滤和token级损失等方面的改进。
2025年即将结束,这一年由基于RLVR和GRPO的推理模型主导,其源头可追溯至1月发布的DeepSeek R1。DeepSeek R1证明了推理行为可通过强化学习培养,且其开放权重模型的性能与专有模型不相上下。该论文还引发了关于训练成本的讨论,尽管最终运行成本估计约为500万美元(不包括研究人员薪资)。RLVR利用可验证奖励(例如数学、代码)进行后训练,减少了对昂贵人工标注的依赖。几乎所有主流大语言模型开发者都发布了推理变体。其他值得关注的焦点包括:2022年的RLHF+PPO、2023年的LoRA SFT、2024年的中训练阶段。对2026-2027年的预测包括RLVR扩展、推理时计算扩展和持续学习。GRPO成为研究热点,诸多数学改进方法(如零梯度过滤、主动采样、token级损失及无KL散度损失)显著提升了训练稳定性。在架构上,最先进的模型仍采用带有混合专家层和效率优化注意力机制(如分组查询注意力、滑动窗口注意力、多头潜在注意力)的解码器式Transformer。最新的效率改进包括Qwen3-Next和Kimi Linear中的Gated DeltaNets,以及NVIDIA Nemotron 3中的Mamba-2层。
来源: Sebastian Raschka —
原文
