За пределами стандартных LLM: линейные гибриды внимания, текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
В статье рассматриваются альтернативы стандартным авторегрессионным LLM на основе трансформеров: линейные гибриды внимания (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры. Автор отмечает возврат к классическому вниманию в MiniMax-M2 и сложность линейного внимания в продакшене.
Автор, Себастьян Рашка, анализирует альтернативы стандартным авторегрессионным LLM на основе трансформеров с механизмом внимания. Среди рассмотренных подходов — линейные гибриды внимания, которые недавно переживают возрождение. К ним относятся MiniMax-M1 (456B параметров, MoE, с lightning attention), Qwen3-Next (использует Gated DeltaNet и Gated Attention в соотношении 3:1), DeepSeek V3.2
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- MoE = Mixture of Experts — смесь экспертов
- SSM = State Space Model — модель пространства состояний
- MLP = Multilayer Perceptron — многослойный перцептрон
- RNN = Recurrent Neural Network — рекуррентная нейронная сеть
- YaRN = Yet another RoPE extensioN — ещё одно расширение RoPE
- SiLU = Sigmoid Linear Unit — сигмоидальная линейная единица
Источник: Sebastian Raschka —
оригинал
