超越标准大语言模型:线性注意力混合体、文本扩散、代码世界模型与小规模递归Transformer
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
Sebastian Raschka的文章探讨了标准自回归Transformer大语言模型的替代方案,包括线性注意力混合体(例如MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、文本扩散模型、代码世界模型和小规模递归Transformer。文章讨论了线性注意力机制的复兴及其挑战,例如MiniMax在其M2模型中因在推理任务上表现不佳而回归标准注意力机制。
Sebastian Raschka 讨论了基于多头注意力的标准自回归解码器风格 Transformer 的替代方案。值得关注的模型包括:采用闪电注意力的 MiniMax-M1、采用门控 DeltaNet 和门控注意力的 Qwen3-Next、采用稀疏注意力的 DeepSeek V3.2 以及 Kimi Linear。然而,MiniMax 在其 M2 模型中回归了常规注意力,理由是其在推理和多轮任务中准确性较差。Qwen3-Next 和 Kimi Linear 以 3:1 的比例混合了线性注意力(门控 DeltaNet)和全注意力(门控注意力)。门控 DeltaNet 将 Mamba2 与用于循环状态更新的 delta 规则相结合。文章还提到了其他替代方案,如文本扩散模型、代码世界模型和小型递归 Transformer,但未详细展开。
来源: Sebastian Raschka —
原文
