⚡ BREAKING
GPT-2 से gpt-oss तक: आर्किटेक्चरल प्रगति और Qwen3 के साथ तुलना
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI ने GPT-2 के बाद अपने पहले ओपन-वेट मॉडल, gpt-oss-120b और gpt-oss-20b, जारी किए। आर्किटेक्चर में मिक्सचर-ऑफ-एक्सपर्ट्स, ग्रुप्ड क्वेरी अटेंशन, RoPE, SwiGLU और स्थानीय इन्फ्रेंस के लिए MXFP4 ऑप्टिमाइज़ेशन शामिल है। GPT-2 और Qwen3 के साथ तुलना चौड़ाई बनाम गहराई ट्रेड-ऑफ और अटेंशन सिंक में प्रगति को उजागर करती है।
OpenAI ने gpt-oss-120b और gpt-oss-20b जारी किए, जो 2019 में GPT-2 के बाद से उनके पहले ओपन-वेट LLM हैं। इन मॉडलों में GPT-2 की तुलना में कई आर्किटेक्चरल सुधार शामिल हैं: ड्रॉपआउट हटाना, पूर्ण स्थिति एम्बेडिंग को RoPE से बदलना, एक्टिवेशन को GELU से SwiGLU में बदलना, मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) जोड़ना, और ग्रुप्ड क्वेरी अटेंशन (GQA) का उपयोग करना। MoE कुल पैरामीटर बढ़ाता है लेकिन प्रति टोकन केवल एक सबसेट को सक्रिय करता है, जिससे अनुमान कुशल रहता है। GQA मेमोरी उपयोग कम करने के लिए की-वैल्यू हेड्स को कम करता है। मॉडल एकल GPU पर फिट होने के लिए MXFP4 ऑप्टिमाइजेशन का उपयोग करते हैं (20B 16GB उपभोक्ता GPU पर, 120B H100 80GB पर)। Qwen3 की तुलना में, gpt-oss चौड़ाई बनाम गहराई के व्यापार-नापसंद का अन्वेषण करता है। अटेंशन बायस और सिंक पर भी चर्चा की गई है। लेख में संदर्भ में GPT-5 का भी संक्षेप में उल्लेख किया गया है। बेंचमार्क प्रतिस्पर्धी प्रदर्शन दिखाते हैं, हालांकि विस्तृत स्कोर प्रदान नहीं किए गए हैं।
स्रोत: Sebastian Raschka —
मूल
