研究模型 🇺🇸 27.07.2026 17:04

超越标准大语言模型:线性注意力混合体、文本扩散模型、代码世界模型和小型循环Transformer

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
文章探讨了标准自回归Transformer大语言模型的替代方案:线性注意力混合体(MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、文本扩散模型、代码世界模型和小型循环Transformer。作者注意到MiniMax-M2回归了经典注意力,以及线性注意力在生产中的复杂性。
Автор, Себастьян Рашка, анализирует альтернативы стандартным авторегрессионным LLM на основе трансформеров с механизмом внимания. Среди рассмотренных подходов — линейные гибриды внимания, которые недавно переживают возрождение. К ним относятся MiniMax-M1 (456B параметров, MoE, с lightning attention), Qwen3-Next (использует Gated DeltaNet и Gated Attention в соотношении 3:1), DeepSeek V3.2 (разреженное внимание, сублинейная сложность) и Kimi Linear (также с Gated DeltaNet). Однако MiniMax-M2 вернулся к стандартному вниманию из-за проблем с точностью в задачах рассуждения и многозадачности. Также упоминаются текстовые диффузионные модели, кодовые модели мира (например, для генерации состояния игры) и малые рекуррентные трансформеры (как 1.5B модель, сравниваемая с GPT-4 на синтаксическом анализе).
来源: Sebastian Raschka — 原文
我们之前关于此话题的帖子 ↓
最新新闻