МоделиИсследования 🇷🇺 19.07.2026 20:04

Mamba: архитектура, которая шла убивать трансформеры — что из этого вышло

В декабре 2023 года исследователи Альберт Гу и Три Дао представили архитектуру Mamba, построенную не на механизме внимания, а на модели пространства состояний. Она оказалась быстрее и экономичнее трансформеров на длинных текстах, но проигрывает в точности извлечения деталей. В итоге вместо вытеснения трансформеров Mamba вошла в гибридные модели, где один слой внимания приходится на семь слоёв Mamba.
Основной недостаток трансформеров — квадратичная сложность по длине контекста из-за механизма внимания, где каждый токен сравнивается со всеми остальными. Mamba решает эту проблему, используя модель пространства состояний (SSM) с одним скрытым состоянием, обновляемым линейно. Главное новшество Mamba — селективность: параметры, определяющие, как токен влияет на состояние, вычисляются динамически на основе самого токена, что позволяет удерживать важную информацию и отсеивать шум. Кроме того, благодаря ассоциативности обновления состояния, обучение можно распараллелить. Однако фиксированный размер состояния приводит к потере деталей, что делает Mamba слабее трансформеров в задачах точного извлечения и копирования. В результате индустрия пошла по пути гибридных моделей: основная масса слоёв — Mamba (экономит память и ускоряет обработку), а немногочисленные слои внимания (примерно один на семь) обеспечивают точный поиск. Так Mamba не вытеснила трансформеры, но стала ключевым компонентом современных высокопроизводительных языковых моделей.
Сокращения
SSM = State Space Model — модель пространства состояний
RNN = Recurrent Neural Network — рекуррентная нейронная сеть
KV-кэш — кэш ключей и значений
Источник: Habr — хаб NLP — оригинал

Наши прошлые публикации по теме

Есть свежие новости