RechercheModèles 🇺🇸 27.07.2026 17:04

Au-delà des LLM standards : hybrides d'attention linéaire, diffusion de texte, modèles de monde de code et petits transformateurs récursifs

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
L'article de Sebastian Raschka explore des alternatives aux LLM transformateurs autorégressifs standards, notamment les hybrides d'attention linéaire (par exemple, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), les modèles de diffusion de texte, les modèles de monde de code et les petits transformateurs récursifs. Il discute du regain d'intérêt pour les mécanismes d'attention linéaire et des défis, comme le retour de MiniMax à l'attention standard dans son modèle M2 en raison de performances insuffisantes sur les tâches de raisonnement.
Sebastian Raschka évoque des alternatives aux transformateurs décodeurs autorégressifs standards, qui reposent sur l'attention multi-tête. Parmi les modèles notables figurent MiniMax-M1 avec l'attention éclair, Qwen3-Next avec Gated DeltaNet et Gated Attention, DeepSeek V3.2 avec l'attention sparse, ainsi que Kimi Linear. Cependant, MiniMax est revenu à l'attention classique dans son modèle M2, invoquant une faible précision dans les tâches de raisonnement et de multitour. Qwen3-Next et Kimi Linear utilisent un ratio 3:1 entre l'attention linéaire (Gated DeltaNet) et l'attention complète (Gated Attention). Gated DeltaNet combine Mamba2 avec une règle delta pour les mises à jour récurrentes de l'état. L'article mentionne également d'autres alternatives comme les modèles de diffusion de texte, les modèles de monde de code et les petits transformateurs récursifs, mais sans entrer dans les détails.
Source: Sebastian Raschka — original
Nos articles précédents sur ce sujet ↓
Infos fraîches