ИсследованияМодели 🇺🇸 27.07.2026 17:04

За пределами стандартных LLM: линейные гибриды внимания, текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
В статье рассматриваются альтернативы стандартным авторегрессионным LLM на основе трансформеров: линейные гибриды внимания (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), текстовые диффузионные модели, кодовые модели мира и малые рекуррентные трансформеры. Автор отмечает возврат к классическому вниманию в MiniMax-M2 и сложность линейного внимания в продакшене.
Автор, Себастьян Рашка, анализирует альтернативы стандартным авторегрессионным LLM на основе трансформеров с механизмом внимания. Среди рассмотренных подходов — линейные гибриды внимания, которые недавно переживают возрождение. К ним относятся MiniMax-M1 (456B параметров, MoE, с lightning attention), Qwen3-Next (использует Gated DeltaNet и Gated Attention в соотношении 3:1), DeepSeek V3.2
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
MoE = Mixture of Experts — смесь экспертов
SSM = State Space Model — модель пространства состояний
MLP = Multilayer Perceptron — многослойный перцептрон
RNN = Recurrent Neural Network — рекуррентная нейронная сеть
YaRN = Yet another RoPE extensioN — ещё одно расширение RoPE
SiLU = Sigmoid Linear Unit — сигмоидальная линейная единица
Источник: Sebastian Raschka — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости