बड़े भाषा मॉडल आर्किटेक्चर की तुलना: DeepSeek V3 से OLMo 2 तक
DeepSeek
Allen Institute for AI
सेबेस्टियन राश्का आधुनिक एलएलएम के आर्किटेक्चर की तुलना करते हैं, जिसमें DeepSeek V3 जिसमें मल्टी-हेड लेटेंट अटेंशन और मिक्सचर-ऑफ-एक्सपर्ट्स हैं, और एलन इंस्टीट्यूट फॉर एआई का OLMo 2 जिसमें पोस्ट-नॉर्म और क्यूके-नॉर्म है। लेख में समूहित-क्वेरी अटेंशन और विभिन्न नॉर्मलाइज़ेशन योजनाओं जैसे प्रमुख आर्किटेक्चरल निर्णयों को शामिल किया गया है।
अपने लेख में, सेबेस्टियन रास्का आधुनिक बड़े भाषा मॉडलों की वास्तुकला संबंधी विशेषताओं की जांच करते हैं, और DeepSeek V3/R1, OLMo 2 तथा अन्य मॉडलों की तुलना करते हैं। DeepSeek V3, मल्टी-हेड लैटेंट अटेंशन (MLA) का उपयोग करता है, जो कीज़ और वैल्यूज़ को एक निम्न-आयामी स्पेस में संपीड़ित करके KV कैश मेमोरी बचाता है, और मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) का उपयोग करता है जिसमें 256 विशेषज्ञ होते हैं, जिनमें से केवल 9 सक्रिय होते हैं (एक साझा विशेषज्ञ और राउटर द्वारा चुने गए 8 विशेषज्ञ), जिससे कुल 671 बिलियन पैरामीटर होने के बावजूद यह प्रति स्टेप केवल 37 बिलियन पैरामीटर का उपयोग करता है। दूसरी ओर, एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस का OLMo 2, पारंपरिक मल्टी-हेड अटेंशन का उपयोग करता है, लेकिन पोस्ट-नॉर्म (अटेंशन और फीड-फॉरवर्ड नेटवर्क लेयर्स के बाद RMSNorm) और QK-नॉर्म के साथ, जो प्रशिक्षण को स्थिर करता है। लेख में ग्रुप्ड-क्वेरी अटेंशन का भी उल्लेख है, जो अन्य मॉडलों में उपयोग किए जाने वाले मल्टी-हेड अटेंशन का एक विकल्प है।
स्रोत: Sebastian Raschka —
मूल
