मॉडलशोध 🇺🇸 27.07.2026 18:04

बड़े भाषा मॉडल आर्किटेक्चर की तुलना: DeepSeek V3 से OLMo 2 तक

DeepSeekDeepSeek Allen Institute for AIAllen Institute for AI
सेबेस्टियन राश्का आधुनिक एलएलएम के आर्किटेक्चर की तुलना करते हैं, जिसमें DeepSeek V3 जिसमें मल्टी-हेड लेटेंट अटेंशन और मिक्सचर-ऑफ-एक्सपर्ट्स हैं, और एलन इंस्टीट्यूट फॉर एआई का OLMo 2 जिसमें पोस्ट-नॉर्म और क्यूके-नॉर्म है। लेख में समूहित-क्वेरी अटेंशन और विभिन्न नॉर्मलाइज़ेशन योजनाओं जैसे प्रमुख आर्किटेक्चरल निर्णयों को शामिल किया गया है।
अपने लेख में, सेबेस्टियन रास्का आधुनिक बड़े भाषा मॉडलों की वास्तुकला संबंधी विशेषताओं की जांच करते हैं, और DeepSeek V3/R1, OLMo 2 तथा अन्य मॉडलों की तुलना करते हैं। DeepSeek V3, मल्टी-हेड लैटेंट अटेंशन (MLA) का उपयोग करता है, जो कीज़ और वैल्यूज़ को एक निम्न-आयामी स्पेस में संपीड़ित करके KV कैश मेमोरी बचाता है, और मिक्सचर-ऑफ़-एक्सपर्ट्स (MoE) का उपयोग करता है जिसमें 256 विशेषज्ञ होते हैं, जिनमें से केवल 9 सक्रिय होते हैं (एक साझा विशेषज्ञ और राउटर द्वारा चुने गए 8 विशेषज्ञ), जिससे कुल 671 बिलियन पैरामीटर होने के बावजूद यह प्रति स्टेप केवल 37 बिलियन पैरामीटर का उपयोग करता है। दूसरी ओर, एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस का OLMo 2, पारंपरिक मल्टी-हेड अटेंशन का उपयोग करता है, लेकिन पोस्ट-नॉर्म (अटेंशन और फीड-फॉरवर्ड नेटवर्क लेयर्स के बाद RMSNorm) और QK-नॉर्म के साथ, जो प्रशिक्षण को स्थिर करता है। लेख में ग्रुप्ड-क्वेरी अटेंशन का भी उल्लेख है, जो अन्य मॉडलों में उपयोग किए जाने वाले मल्टी-हेड अटेंशन का एक विकल्प है।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार