मानक एलएलएम से परे: लीनियर अटेंशन हाइब्रिड, टेक्स्ट डिफ्यूज़न, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Allen Institute for AI
xAI
OpenAI
IBM
NVIDIA
सेबेस्टियन रश्का का लेख मानक ऑटोरिग्रेसिव ट्रांसफॉर्मर एलएलएम के विकल्पों की पड़ताल करता है, जिसमें लीनियर अटेंशन हाइब्रिड (जैसे, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), टेक्स्ट डिफ्यूज़न मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर शामिल हैं। यह लीनियर अटेंशन मैकेनिज्म के पुनरुत्थान और चुनौतियों पर चर्चा करता है, जैसे कि तर्क कार्यों पर खराब प्रदर्शन के कारण MiniMax ने अपने M2 मॉडल में मानक अटेंशन पर वापस लौटना।
सेबेस्टियन रास्का मल्टी-हेड अटेंशन पर आधारित मानक ऑटोरेग्रेसिव डिकोडर-स्टाइल ट्रांसफॉर्मर के विकल्पों पर चर्चा करते हैं। उल्लेखनीय मॉडलों में लाइटनिंग अटेंशन वाला MiniMax-M1, गेटेड डेल्टानेट और गेटेड अटेंशन वाला Qwen3-Next, स्पार्स अटेंशन वाला DeepSeek V3.2 और Kimi Linear शामिल हैं। हालांकि, MiniMax ने अपने M2 मॉडल में रेगुलर अटेंशन पर वापस लौटते हुए रीज़निंग और मल्टी-टर्न कार्यों में खराब सटीकता का हवाला दिया। Qwen3-Next और Kimi Linear लीनियर अटेंशन (गेटेड डेल्टानेट) और फुल अटेंशन (गेटेड अटेंशन) का 3:1 अनुपात उपयोग करते हैं। गेटेड डेल्टानेट रिकरंट स्टेट अपडेट के लिए डेल्टा नियम के साथ Mamba2 को जोड़ता है। लेख में टेक्स्ट डिफ्यूजन मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर जैसे अन्य विकल्पों का भी उल्लेख है, लेकिन उनका विवरण नहीं दिया गया है।
स्रोत: Sebastian Raschka —
मूल
