Mamba: la arquitectura que pretendía acabar con los Transformers
Moonshot AI
La arquitectura Mamba, basada en espacios de estado selectivos (SSM), se presentó como una alternativa a los transformers, prometiendo complejidad lineal en lugar de cuadrática. Sin embargo, en la práctica, Mamba no reemplazó a los transformers, sino que entró en modelos híbridos, donde se combina con capas de atención: aproximadamente una capa de atención por cada siete capas Mamba.
En diciembre de 2023, los investigadores Albert Gu y Tri Dao presentaron la arquitectura Mamba, basada en modelos de espacio de estado selectivos (SSMs). A diferencia de los transformadores, donde cada token se compara con todos los demás (complejidad cuadrática O(N²)), Mamba utiliza un único estado oculto de tamaño fijo que se actualiza secuencialmente con complejidad lineal. La innovación clave es un mecanismo selectivo: los parámetros de actualización del estado (A, B, C) se recalculan para cada token, lo que permite al modelo decidir qué información retener y cuál descartar, similar al mecanismo de atención pero sin el costo cuadrático. Gracias a la asociatividad de los cálculos, el entrenamiento de Mamba se puede paralelizar, resolviendo el problema del entrenamiento lento inherente a las RNN antiguas. Sin embargo, Mamba tiene desventajas: el estado fijo comprime la información, degradando la capacidad de extracción precisa de detalles y de copia en comparación con los transformadores, que almacenan explícitamente todos los tokens. Por lo tanto, Mamba no ha reemplazado a los transformadores, sino que se utiliza en modelos híbridos, donde se añade aproximadamente una capa de atención por cada siete capas de Mamba. Esta combinación preserva la memoria larga y barata de Mamba y la recuperación precisa de los transformadores. Como resultado, muchos modelos modernos pueden usar Mamba de forma implícita.
Fuente: Habr — хаб NLP —
original
