RechercheModèles 🇷🇺 27.07.2026 03:03

Mamba : l'architecture qui visait à tuer les transformers

Moonshot AIMoonshot AI
L'architecture Mamba, basée sur les espaces d'état sélectifs (selective state spaces, SSM), a été présentée comme une alternative aux transformers, promettant une complexité linéaire plutôt que quadratique. En pratique, cependant, Mamba n'a pas remplacé les transformers mais a intégré des modèles hybrides, où elle est combinée à des couches d'attention : environ une couche d'attention pour sept couches Mamba.
En décembre 2023, les chercheurs Albert Gu et Tri Dao ont présenté l'architecture Mamba, basée sur des modèles d'espace d'état sélectifs (SSM). Contrairement aux transformeurs, où chaque jeton est comparé à tous les autres (complexité quadratique O(N²)), Mamba utilise un unique état caché de taille fixe qui est mis à jour séquentiellement avec une complexité linéaire. L'innovation clé réside dans un mécanisme sélectif : les paramètres de mise à jour de l'état (A, B, C) sont recalculés pour chaque jeton, permettant au modèle de décider quelles informations retenir et lesquelles ignorer, à la manière du mécanisme d'attention mais sans coût quadratique. Grâce à l'associativité des calculs, l'entraînement de Mamba peut être parallélisé, résolvant le problème de l'entraînement lent inhérent aux anciens RNN. Cependant, Mamba présente des inconvénients : l'état fixe comprime l'information, ce qui dégrade l'extraction précise des détails et la capacité de copie par rapport aux transformeurs, qui stockent explicitement tous les jetons. Par conséquent, Mamba n'a pas remplacé les transformeurs, mais est utilisé dans des modèles hybrides, où environ une couche d'attention est ajoutée pour sept couches Mamba. Cette combinaison préserve la mémoire longue peu coûteuse de Mamba et la récupération précise des transformeurs. Ainsi, de nombreux modèles modernes peuvent implicitement utiliser Mamba.
Source: Habr — хаб NLP — original
Nos articles précédents sur ce sujet ↓
Infos fraîches