Mamba:立志要取代Transformer的架构
Moonshot AI
Mamba架构基于选择性状态空间模型(SSM),作为Transformer的替代方案被提出,承诺线性复杂度而非二次复杂度。然而在实践中,Mamba并未取代Transformer,而是被整合到混合模型中,与注意力层结合使用:大约每七个Mamba层搭配一个注意力层。
2023年12月,研究人员Albert Gu和Tri Dao提出了基于选择性状态空间模型(SSM)的Mamba架构。与每个token都要与其他所有token进行比较(O(N²)的二次复杂度)的Transformer不同,Mamba使用一个固定大小的隐藏状态顺序更新,具有线性复杂度。关键创新在于选择性机制:更新状态的参数(A、B、C)对每个token重新计算,使模型能够决定保留哪些信息、丢弃哪些信息,类似于注意力机制但无需二次开销。由于计算的可结合性,Mamba的训练可以并行化,解决了传统RNN训练缓慢的问题。然而,Mamba也存在缺点:固定状态会压缩信息,导致精确提取细节和复制能力不如Transformer(Transformer会显式存储所有token)。因此,Mamba并未取代Transformer,而是被用于混合模型中,大约每七个Mamba层添加一个注意力层。这种结合兼顾了Mamba的低成本长程记忆和Transformer的精确检索。最终,许多现代模型可能会隐式地使用Mamba。
来源: Habr — хаб NLP —
原文
