Mamba: una alternativa de complejidad lineal al Transformer
Princeton University (Sengupta Lab)
Mamba, un nuevo modelo de espacio de estados, ofrece una alternativa de tiempo lineal a los Transformers, prometiendo un rendimiento comparable con una inferencia hasta 5 veces más rápida y el manejo de secuencias de millones de tokens. Elimina el cuello de botella cuadrático de la atención mediante un mecanismo selectivo de espacio de estados.
Mamba es un Modelo de Espacio de Estado Selectivo (SSM, por sus siglas en inglés) que pretende reemplazar el mecanismo de atención en los Transformers. Logra un escalado lineal en la longitud de secuencia, lo que permite procesar eficientemente contextos de hasta un millón de tokens. El modelo utiliza un SSM inspirado en la teoría de control para la comunicación entre tokens y conserva las MLP (Perceptrones Multicapa) para el cálculo. Mamba-3B supera a los Transformers del mismo tamaño y iguala en rendimiento a modelos del doble de tamaño en tareas de preentrenamiento y posteriores. Las ventajas clave incluyen una inferencia más rápida (hasta 5 veces), menor huella de memoria y la capacidad de manejar secuencias muy largas. El mecanismo de selectividad permite transiciones de estado dependientes de la entrada, mejorando la efectividad sobre los SSM tradicionales.
Fuente: The Gradient —
original
