линейной сложностью. Ключевое нововведение — селективный механизм: параметры обновления состояния (A, B, C) пересчитываются для каждого токена, что позволяет модели решать, какую информацию сохранить, а какую отбросить, аналогично механизму внимания, но без квадратичных затрат. Благодаря ассоциативности вычислений обучение Mamba можно распараллелить, что решает проблему медленного обучения, присущую старым RNN. Однако у Mamba есть недостатки: фиксированное состояние сжимает информацию, ухудшая способность к точному извлечению деталей и копированию по сравнению с трансформерами, которые явно хранят все токены. Поэтому Mamba не заменила трансформеры, а используется в гибридных моделях, где примерно один слой внимания добавляется на каждые семь слоёв Mamba. Такое сочетание сохраняет дешёвую долгую память Mamba и точное извлечение трансформеров. В результате многие современные модели могут неявно использовать Mamba.