Mamba : une alternative à complexité linéaire au Transformer
Princeton University (Sengupta Lab)
Mamba, un nouveau modèle d'espace d'état (State Space Model), offre une alternative en temps linéaire aux Transformers, promettant des performances comparables avec une inférence jusqu'à 5 fois plus rapide et la gestion de séquences d'un million de tokens. Il supprime le goulot d'étranglement quadratique de l'attention en utilisant un mécanisme d'état sélectif.
Mamba est un modèle d'espace d'état sélectif (SSM) qui vise à remplacer le mécanisme d'attention des Transformers. Il permet un passage à l'échelle linéaire en fonction de la longueur des séquences, ce qui permet de traiter efficacement des contextes allant jusqu'à un million de tokens. Le modèle utilise un SSM inspiré de la théorie du contrôle pour la communication entre tokens et conserve des MLP pour le calcul. Mamba-3B surpasse les Transformers de même taille et atteint les performances de modèles deux fois plus grands lors du pré-entraînement et des tâches en aval. Ses principaux avantages incluent une inférence plus rapide (jusqu'à 5 fois), une empreinte mémoire réduite et la capacité de gérer de très longues séquences. Le mécanisme de sélectivité permet des transitions d'état dépendantes des entrées, améliorant ainsi l'efficacité par rapport aux SSM traditionnels.
Source: The Gradient —
original
