आधुनिक LLM में अटेंशन वेरिएंट्स की एक दृश्य मार्गदर्शिका
OpenAI
Allen Institute for AI
Meta
Alibaba/Qwen
Google/DeepMind
Mistral
Hugging Face
Cohere
यह लेख आधुनिक बड़े भाषा मॉडलों में अटेंशन तंत्रों का एक दृश्य अवलोकन प्रदान करता है, जिसमें मानक मल्टी-हेड अटेंशन (MHA) से लेकर ग्रुप्ड-क्वेरी अटेंशन (GQA), मल्टी-हेड लेटेंट अटेंशन (MLA), स्पार्स अटेंशन और हाइब्रिड आर्किटेक्चर शामिल हैं। इसके साथ 45 प्रविष्टियों और पोस्टर संस्करणों वाला एक LLM आर्किटेक्चर गैलरी भी है।
सेबेस्टियन राश्का ने आधुनिक LLM में अटेंशन वेरिएंट्स का एक विज़ुअल गाइड प्रकाशित किया, साथ ही 45 LLM आर्किटेक्चर की एक गैलरी भी जारी की। यह लेख मल्टी-हेड अटेंशन (MHA), इसके ऐतिहासिक संदर्भ और ग्रुप्ड-क्वेरी अटेंशन (GQA) को कवर करता है, जो की-वैल्यू हेड्स को साझा करके KV-कैश लागत को कम करता है। GQA दक्षता और गुणवत्ता के बीच एक लोकप्रिय समझौता है। डीपसीक V3 में उपयोग किया जाने वाला मल्टी-हेड लेटेंट अटेंशन (MLA) कैश को अधिक आक्रामक रूप से संपीड़ित करता है और बेहतर प्रदर्शन बनाए रखता है। यह लेख स्पार्स अटेंशन और हाइब्रिड आर्किटेक्चर पर भी चर्चा करता है, और प्रत्येक वेरिएंट के लिए उदाहरण मॉडल शामिल करता है। रेडबबल के माध्यम से एक पोस्टर संस्करण उपलब्ध है।
स्रोत: Sebastian Raschka —
मूल
