शोधमॉडल 🇷🇺 27.07.2026 03:03

माम्बा: वह आर्किटेक्चर जिसने ट्रांसफॉर्मर्स को खत्म करने का लक्ष्य रखा था

Moonshot AIMoonshot AI
माम्बा आर्किटेक्चर, जो चयनात्मक स्टेट स्पेसेज (एसएसएम) पर आधारित है, को ट्रांसफॉर्मर्स के विकल्प के रूप में पेश किया गया था, जिसमें क्वाड्रैटिक के बजाय लीनियर कॉम्प्लेक्सिटी का वादा किया गया था। हालांकि, व्यवहार में माम्बा ने ट्रांसफॉर्मर्स को प्रतिस्थापित नहीं किया, बल्कि हाइब्रिड मॉडलों में प्रवेश किया, जहां इसे अटेंशन लेयर्स के साथ जोड़ा जाता है: लगभग हर सात माम्बा लेयर्स पर एक अटेंशन लेयर।
दिसंबर 2023 में, शोधकर्ताओं अल्बर्ट गु और त्रि दाओ ने चयनात्मक राज्य अंतरिक्ष मॉडल (SSMs) पर आधारित माम्बा आर्किटेक्चर पेश किया। ट्रांसफॉर्मर्स के विपरीत, जहां प्रत्येक टोकन की तुलना अन्य सभी से की जाती है (द्विघात जटिलता O(N²)), माम्बा एक निश्चित आकार की एकल छिपी हुई स्थिति का उपयोग करता है जिसे रैखिक जटिलता के साथ क्रमिक रूप से अपडेट किया जाता है। मुख्य नवाचार एक चयनात्मक तंत्र है: राज्य अद्यतन पैरामीटर (A, B, C) प्रत्येक टोकन के लिए पुनर्गणना किए जाते हैं, जिससे मॉडल यह तय कर सकता है कि कौन सी जानकारी रखनी है और किसे छोड़ना है, जो ध्यान तंत्र के समान है लेकिन द्विघात लागत के बिना। गणनाओं की साहचर्यता के कारण, माम्बा प्रशिक्षण को समानांतर किया जा सकता है, जो पुराने RNNs में निहित धीमी प्रशिक्षण समस्या को हल करता है। हालांकि, माम्बा में कमियां हैं: निश्चित अवस्था जानकारी को संपीड़ित करती है, जिससे ट्रांसफॉर्मर्स की तुलना में सटीक विवरण निकालने और कॉपी करने की क्षमता कम हो जाती है, जो सभी टोकन को स्पष्ट रूप से संग्रहीत करते हैं। इसलिए, माम्बा ने ट्रांसफॉर्मर्स को प्रतिस्थापित नहीं किया है, बल्कि संकर मॉडलों में उपयोग किया जाता है, जहां प्रत्येक सात माम्बा परतों के लिए लगभग एक ध्यान परत जोड़ी जाती है। यह संयोजन माम्बा की सस्ती लंबी मेमोरी और ट्रांसफॉर्मर्स की सटीक पुनर्प्राप्ति को संरक्षित करता है। परिणामस्वरूप, कई आधुनिक मॉडल अंतर्निहित रूप से माम्बा का उपयोग कर सकते हैं।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार