Au-delà des LLM standard : hybrides d’attention linéaire, modèles de diffusion de texte, modèles de monde de code et petits transformeurs récurrents
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
L’article explore des alternatives aux LLM standards basés sur l’attention autorégressive des transformeurs : les hybrides d’attention linéaire (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), les modèles de diffusion de texte, les modèles de monde de code et les petits transformeurs récurrents. L’auteur note un retour à l’attention classique dans MiniMax-M2 et la complexité de l’attention linéaire en production.
Автор, Себастьян Рашка, анализирует альтернативы стандартным авторегрессионным LLM на основе трансформеров с механизмом внимания. Среди рассмотренных подходов — линейные гибриды внимания, которые недавно переживают возрождение. К ним относятся MiniMax-M1 (456B параметров, MoE, с lightning attention), Qwen3-Next (использует Gated DeltaNet и Gated Attention в соотношении 3:1), DeepSeek V3.2 (разреженное внимание, сублинейная сложность) и Kimi Linear (также с Gated DeltaNet). Однако MiniMax-M2 вернулся к стандартному вниманию из-за проблем с точностью в задачах рассуждения и многозадачности. Также упоминаются текстовые диффузионные модели, кодовые модели мира (например, для генерации состояния игры) и малые рекуррентные трансформеры (как 1.5B модель, сравниваемая с GPT-4 на синтаксическом анализе).
Source: Sebastian Raschka —
original
