Mamba:変圧器を駆逐しようとしたアーキテクチャ
Moonshot AI
Mambaアーキテクチャは、選択的状態空間モデル(SSM)に基づき、トランスフォーマーの代替として導入され、二次ではなく線形の複雑性を約束しました。しかし実際には、Mambaはトランスフォーマーを置き換えるのではなく、ハイブリッドモデルに採用され、注意機構層と組み合わされています。具体的には、Mamba層7層に対して注意機構層1層程度の割合です。
2023年12月、研究者のAlbert GuとTri Daoは、選択的状態空間モデル(State Space Models, SSMs)に基づくアーキテクチャ「Mamba」を発表しました。トランスフォーマー(Transformer)では各トークンが他のすべてのトークンと比較される(二次複雑性O(N²))のに対し、Mambaは固定サイズの単一隠れ状態を逐次的に更新し、線形複雑性で処理します。主な革新は選択的メカニズムで、トークンごとに状態更新パラメータ(A, B, C)を再計算し、アテンション(Attention)機構と同様に、どの情報を保持し、どの情報を破棄するかをモデルが決定しますが、二次コストはかかりません。計算の結合性により、Mambaの学習は並列化可能で、従来のリカレントニューラルネットワーク(Recurrent Neural Network, RNN)にあった学習の遅さの問題を解決しています。ただし、Mambaには欠点もあります。固定状態が情報を圧縮するため、トランスフォーマー(全トークンを明示的に保存)と比較して、正確な詳細抽出やコピー能力が低下します。そのため、Mambaはトランスフォーマーに取って代わることはなく、ハイブリッドモデルで使用され、Mamba層7つにつきおおよそ1つのアテンション層が追加されます。この組み合わせにより、Mambaの安価な長期記憶とトランスフォーマーの正確な検索が維持されます。結果として、多くの現代のモデルが暗黙のうちにMambaを利用している可能性があります。
出典: Habr — хаб NLP —
原文
