За пределами стандартных LLM: линейные гибриды внимания, текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры
В статье рассматриваются альтернативы стандартным авторегрессионным LLM на основе трансформеров: линейные гибриды внимания (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры. Автор отмечает возврат к классическому вниманию в MiniMax-M2 и сложность линейного внимания в продакшене.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
Sebastian Raschka27.07 · 17:04
