超越标准大语言模型:线性注意力混合体、文本扩散模型、代码世界模型和小型循环Transformer
文章探讨了标准自回归Transformer大语言模型的替代方案:线性注意力混合体(MiniMax-M1、Qwen3-Next、DeepSeek V3.2、Kimi Linear)、文本扩散模型、代码世界模型和小型循环Transformer。作者注意到MiniMax-M2回归了经典注意力,以及线性注意力在生产中的复杂性。
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
Sebastian Raschka27.07 · 17:04



