Mamba: Uma Alternativa de Complexidade Linear ao Transformer
Princeton University (Sengupta Lab)
Mamba, um novo Modelo de Espaço de Estados, oferece uma alternativa de tempo linear aos Transformers, prometendo desempenho comparável com inferência até 5 vezes mais rápida e capacidade de lidar com sequências de milhões de tokens. Ele remove o gargalo quadrático da atenção usando um mecanismo de espaço de estados seletivo.
Mamba é um Modelo de Espaço de Estados Seletivo (SSM, na sigla em inglês) que visa substituir o mecanismo de atenção em Transformers. Ele alcança escalonamento linear no comprimento da sequência, permitindo o processamento eficiente de contextos de até um milhão de tokens. O modelo utiliza um SSM inspirado na teoria de controle para comunicação entre tokens e mantém MLPs para computação. O Mamba-3B supera Transformers do mesmo tamanho e se iguala a modelos com o dobro do tamanho em pré-treinamento e tarefas downstream. As principais vantagens incluem inferência mais rápida (até 5 vezes), menor consumo de memória e a capacidade de lidar com sequências muito longas. O mecanismo de seletividade permite transições de estado dependentes da entrada, melhorando a eficácia em relação aos SSMs tradicionais.
Fonte: The Gradient —
original
