शोधमॉडल 🇺🇸 27.07.2026 17:04

मानक एलएलएम से परे: लीनियर अटेंशन हाइब्रिड, टेक्स्ट डिफ्यूज़न, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर

Moonshot AIMoonshot AI MiniMaxMiniMax Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MistralMistral MetaMeta Hugging FaceHugging Face Allen Institute for AIAllen Institute for AI xAIxAI OpenAIOpenAI IBMIBM NVIDIANVIDIA
सेबेस्टियन रश्का का लेख मानक ऑटोरिग्रेसिव ट्रांसफॉर्मर एलएलएम के विकल्पों की पड़ताल करता है, जिसमें लीनियर अटेंशन हाइब्रिड (जैसे, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), टेक्स्ट डिफ्यूज़न मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर शामिल हैं। यह लीनियर अटेंशन मैकेनिज्म के पुनरुत्थान और चुनौतियों पर चर्चा करता है, जैसे कि तर्क कार्यों पर खराब प्रदर्शन के कारण MiniMax ने अपने M2 मॉडल में मानक अटेंशन पर वापस लौटना।
सेबेस्टियन रास्का मल्टी-हेड अटेंशन पर आधारित मानक ऑटोरेग्रेसिव डिकोडर-स्टाइल ट्रांसफॉर्मर के विकल्पों पर चर्चा करते हैं। उल्लेखनीय मॉडलों में लाइटनिंग अटेंशन वाला MiniMax-M1, गेटेड डेल्टानेट और गेटेड अटेंशन वाला Qwen3-Next, स्पार्स अटेंशन वाला DeepSeek V3.2 और Kimi Linear शामिल हैं। हालांकि, MiniMax ने अपने M2 मॉडल में रेगुलर अटेंशन पर वापस लौटते हुए रीज़निंग और मल्टी-टर्न कार्यों में खराब सटीकता का हवाला दिया। Qwen3-Next और Kimi Linear लीनियर अटेंशन (गेटेड डेल्टानेट) और फुल अटेंशन (गेटेड अटेंशन) का 3:1 अनुपात उपयोग करते हैं। गेटेड डेल्टानेट रिकरंट स्टेट अपडेट के लिए डेल्टा नियम के साथ Mamba2 को जोड़ता है। लेख में टेक्स्ट डिफ्यूजन मॉडल, कोड वर्ल्ड मॉडल और छोटे रिकर्सिव ट्रांसफॉर्मर जैसे अन्य विकल्पों का भी उल्लेख है, लेकिन उनका विवरण नहीं दिया गया है।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार