⚡ BREAKING
मॉडलशोध 🇺🇸 27.07.2026 18:03

GPT-2 से gpt-oss तक: आर्किटेक्चरल प्रगति और Qwen3 के साथ तुलना

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI ने GPT-2 के बाद अपने पहले ओपन-वेट मॉडल, gpt-oss-120b और gpt-oss-20b, जारी किए। आर्किटेक्चर में मिक्सचर-ऑफ-एक्सपर्ट्स, ग्रुप्ड क्वेरी अटेंशन, RoPE, SwiGLU और स्थानीय इन्फ्रेंस के लिए MXFP4 ऑप्टिमाइज़ेशन शामिल है। GPT-2 और Qwen3 के साथ तुलना चौड़ाई बनाम गहराई ट्रेड-ऑफ और अटेंशन सिंक में प्रगति को उजागर करती है।
OpenAI ने gpt-oss-120b और gpt-oss-20b जारी किए, जो 2019 में GPT-2 के बाद से उनके पहले ओपन-वेट LLM हैं। इन मॉडलों में GPT-2 की तुलना में कई आर्किटेक्चरल सुधार शामिल हैं: ड्रॉपआउट हटाना, पूर्ण स्थिति एम्बेडिंग को RoPE से बदलना, एक्टिवेशन को GELU से SwiGLU में बदलना, मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) जोड़ना, और ग्रुप्ड क्वेरी अटेंशन (GQA) का उपयोग करना। MoE कुल पैरामीटर बढ़ाता है लेकिन प्रति टोकन केवल एक सबसेट को सक्रिय करता है, जिससे अनुमान कुशल रहता है। GQA मेमोरी उपयोग कम करने के लिए की-वैल्यू हेड्स को कम करता है। मॉडल एकल GPU पर फिट होने के लिए MXFP4 ऑप्टिमाइजेशन का उपयोग करते हैं (20B 16GB उपभोक्ता GPU पर, 120B H100 80GB पर)। Qwen3 की तुलना में, gpt-oss चौड़ाई बनाम गहराई के व्यापार-नापसंद का अन्वेषण करता है। अटेंशन बायस और सिंक पर भी चर्चा की गई है। लेख में संदर्भ में GPT-5 का भी संक्षेप में उल्लेख किया गया है। बेंचमार्क प्रतिस्पर्धी प्रदर्शन दिखाते हैं, हालांकि विस्तृत स्कोर प्रदान नहीं किए गए हैं।
स्रोत: Sebastian Raschka — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार