Au-delà des LLM standard : hybrides d’attention linéaire, modèles de diffusion de texte, modèles de monde de code et petits transformeurs récurrents
L’article explore des alternatives aux LLM standards basés sur l’attention autorégressive des transformeurs : les hybrides d’attention linéaire (MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), les modèles de diffusion de texte, les modèles de monde de code et les petits transformeurs récurrents. L’auteur note un retour à l’attention classique dans MiniMax-M2 et la complexité de l’attention linéaire en production.
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA

