मानक एलएलएम से परे: लीनियर अटेंशन हाइब्रिड, टेक्स्ट डिफ्यूज़न, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
सेबेस्टियन रश्का का लेख मानक ऑटोरिग्रेसिव ट्रांसफॉर्मर एलएलएम के विकल्पों की पड़ताल करता है, जिसमें लीनियर अटेंशन हाइब्रिड (जैसे, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), टेक्स्ट डिफ्यूज़न मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर शामिल हैं। यह लीनियर अटेंशन मैकेनिज्म के पुनरुत्थान और चुनौतियों पर चर्चा करता है, जैसे कि तर्क कार्यों पर खराब प्रदर्शन के कारण MiniMax ने अपने M2 मॉडल में मानक अटेंशन पर वापस लौटना।
सेबेस्टियन रास्का मल्टी-हेड अटेंशन पर आधारित मानक ऑटोरेग्रेसिव डिकोडर-स्टाइल ट्रांसफॉर्मर के विकल्पों पर चर्चा करते हैं। उल्लेखनीय मॉडलों में लाइटनिंग अटेंशन वाला MiniMax-M1, गेटेड डेल्टानेट और गेटेड अटेंशन वाला Qwen3-Next, स्पार्स अटेंशन वाला DeepSeek V3.2 और Kimi Linear शामिल हैं। हालांकि, MiniMax ने अपने M2 मॉडल में रेगुलर अटेंशन पर वापस लौटते हुए रीज़निंग और मल्टी-टर्न कार्यों में खराब सटीकता का हवाला दिया। Qwen3-Next और Kimi Linear लीनियर अटेंशन (गेटेड डेल्टानेट) और फुल अटेंशन (गेटेड अटेंशन) का 3:1 अनुपात उपयोग करते हैं। गेटेड डेल्टानेट रिकरंट स्टेट अपडेट के लिए डेल्टा नियम के साथ Mamba2 को जोड़ता है। लेख में टेक्स्ट डिफ्यूजन मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर जैसे अन्य विकल्पों का भी उल्लेख है, लेकिन उनका विवरण नहीं दिया गया है।
स्रोत: Sebastian Raschka —
मूल
