Mamba: Transformers’ı Öldürmek İçin Yola Çıkan Mimari
Moonshot AI
Seçici durum uzaylarına (SSM) dayanan Mamba mimarisi, transformerlara alternatif olarak ortaya çıktı ve ikinci dereceden karmaşıklık yerine doğrusal karmaşıklık vaat etti. Ancak pratikte Mamba, transformerlarların yerini almadı, dikkat katmanlarıyla birleştirildiği hibrit modellere girdi: kabaca her yedi Mamba katmanına bir dikkat katmanı.
Aralık 2023'te araştırmacılar Albert Gu ve Tri Dao, seçici durum uzayı modellerine (SSM) dayanan Mamba mimarisini tanıttı. Her tokenin diğer tüm tokenlerle karşılaştırıldığı (ikinci dereceden karmaşıklık O(N²)) transformatörlerin aksine Mamba, sıralı olarak doğrusal karmaşıklıkla güncellenen sabit boyutlu tek bir gizli durum kullanır. Temel yenilik, seçici bir mekanizmadır: durum güncelleme parametreleri (A, B, C) her token için yeniden hesaplanır, bu da modelin hangi bilgiyi tutacağına ve hangisini atacağına karar vermesini sağlar; bu, dikkat mekanizmasına benzer ancak ikinci dereceden maliyet olmadan. Hesaplamaların birleşme özelliği sayesinde Mamba eğitimi paralelleştirilebilir, eski RNN'lerin doğasında olan yavaş eğitim sorununu çözer. Bununla birlikte, Mamba'nın dezavantajları vardır: sabit durum bilgiyi sıkıştırarak, tüm tokenleri açıkça depolayan transformatörlere kıyasla hassas detay çıkarma ve kopyalama yeteneğini bozar. Bu nedenle Mamba, transformatörlerin yerini almamış, hibrit modellerde kullanılmıştır; bu modellerde kabaca her yedi Mamba katmanına bir dikkat katmanı eklenir. Bu kombinasyon, Mamba'nın ucuz uzun süreli hafızasını ve transformatörlerin hassas geri çağırma yeteneğini korur. Sonuç olarak, birçok modern model örtük olarak Mamba kullanıyor olabilir.
Kaynak: Habr — хаб NLP —
orijinal
