模型研究 🇺🇸 28.07.2026 00:02

2026年初春开放大语言模型浪潮:10种架构解析

Arcee AIArcee AI Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MiniMaxMiniMax CohereCohere
回顾2026年春季发布的十款开放大语言模型,重点关注其架构的异同。关键模型包括 Trinity Large、Kimi K2.5、Step 3.5 Flash、Qwen3-Coder-Next 等。
作者概述了2026年1月至2月发布的十款开源大语言模型,重点关注其架构细节。Arcee AI发布了Trinity Large(400B MoE,13B激活参数),采用局部-全局注意力(3:1)、QK-Norm、NoPE、门控注意力以及四个RMSNorm层。Moonshot AI推出了Kimi K2.5(1万亿参数)——这是K2的多模态扩展,基于15万亿视觉和文本令牌进行训练,采用了早期融合技术。StepFun的Step 3.5 Flash(196B MoE,11B激活参数)借助多令牌预测(MTP-3),在128k上下文长度下实现了每秒100个令牌的处理速度。Qwen3-Coder-Next(80B,3B激活参数)凭借门控DeltaNet与门控注意力的混合架构(3:1),在编码任务上超越了更大的模型。此外,文中还提到了z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen 3.5、蚂蚁集团的Ling 2.5和Ring 2.5、Cohere的Tiny Aya,以及Sarvam 30B和105B模型。
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻