शोधमॉडल 🇺🇸 28.07.2026 15:05

आधुनिक LLM में अटेंशन वेरिएंट्स की एक दृश्य मार्गदर्शिका

OpenAIOpenAI Allen Institute for AIAllen Institute for AI MetaMeta Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind MistralMistral Hugging FaceHugging Face CohereCohere
यह लेख आधुनिक बड़े भाषा मॉडलों में अटेंशन तंत्रों का एक दृश्य अवलोकन प्रदान करता है, जिसमें मानक मल्टी-हेड अटेंशन (MHA) से लेकर ग्रुप्ड-क्वेरी अटेंशन (GQA), मल्टी-हेड लेटेंट अटेंशन (MLA), स्पार्स अटेंशन और हाइब्रिड आर्किटेक्चर शामिल हैं। इसके साथ 45 प्रविष्टियों और पोस्टर संस्करणों वाला एक LLM आर्किटेक्चर गैलरी भी है।
सेबेस्टियन राश्का ने आधुनिक LLM में अटेंशन वेरिएंट्स का एक विज़ुअल गाइड प्रकाशित किया, साथ ही 45 LLM आर्किटेक्चर की एक गैलरी भी जारी की। यह लेख मल्टी-हेड अटेंशन (MHA), इसके ऐतिहासिक संदर्भ और ग्रुप्ड-क्वेरी अटेंशन (GQA) को कवर करता है, जो की-वैल्यू हेड्स को साझा करके KV-कैश लागत को कम करता है। GQA दक्षता और गुणवत्ता के बीच एक लोकप्रिय समझौता है। डीपसीक V3 में उपयोग किया जाने वाला मल्टी-हेड लेटेंट अटेंशन (MLA) कैश को अधिक आक्रामक रूप से संपीड़ित करता है और बेहतर प्रदर्शन बनाए रखता है। यह लेख स्पार्स अटेंशन और हाइब्रिड आर्किटेक्चर पर भी चर्चा करता है, और प्रत्येक वेरिएंट के लिए उदाहरण मॉडल शामिल करता है। रेडबबल के माध्यम से एक पोस्टर संस्करण उपलब्ध है।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार