From GPT-2 to gpt-oss: Analysis of Architectural Improvements and Comparison with Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI has released its first open-weight models since 2019 — gpt-oss-120b and gpt-oss-20b. The article examines key architectural changes compared to GPT-2: removal of dropout, replacement of absolute positional embeddings with RoPE, transition from GELU to SwiGLU, introduction of mixture of experts (MoE) and grouped query attention (GQA). It also discusses MXFP4 optimization for running on a single GPU and comparison with Qwen3 and GPT-5.
OpenAI ने आखिरकार छह सालों में अपने पहले ओपन-वेट मॉडल — gpt-oss-120b और gpt-oss-20b — जारी कर दिए हैं। GPT-2 (2019) के विपरीत, आर्किटेक्चर में कई बदलाव हुए हैं। पहला, ड्रॉपआउट पूरी तरह हटा दिया गया: LLM में, जो विशाल डेटासेट पर सिर्फ एक एपॉक के लिए प्रशिक्षित होते हैं, यह केवल परिणाम खराब करता है। GPT-2 की तरह एब्सोल्यूट पोज़ीशनल एम्बेडिंग के बजाय, अब RoPE (रोटरी पोज़ीशन एम्बेडिंग) का उपयोग किया जाता है, जो क्वेरी और की वेक्टरों को घुमाकर स्थिति को एन्कोड करता है। GELU एक्टिवेशन फंक्शन को कम्प्यूटेशनल रूप से सस्ते Swish से बदल दिया गया, और फीड-फ़ॉरवर्ड ब्लॉक को गेटेड लीनियर मॉड्यूल SwiGLU में बदल दिया गया, जो कम पैरामीटर के साथ अधिक अभिव्यक्ति देता है। इसके अलावा, सिंगल फीड-फ़ॉरवर्ड मॉड्यूल को मिक्सचर ऑफ एक्सपर्ट्स (MoE) से बदल दिया गया: 20B मॉडल में प्रति टोकन 8 में से केवल 1 एक्सपर्ट सक्रिय होता है, जिससे कम्प्यूटेशनल लागत बढ़ाए बिना मॉडल की कुल क्षमता बढ़ जाती है। अंत में, मल्टी-हेड अटेंशन ने ग्रुप्ड क्वेरी अटेंशन (GQA) का स्थान ले लिया — की और वैल्यू अब कई हेड्स के बीच साझा की जाती हैं, जिससे मेमोरी बचती है और इन्फ़रेंस तेज़ होता है। MXFP4 ऑप्टिमाइज़ेशन के कारण, 20B मॉडल 16 GB मेमोरी वाले कंज्यूमर GPU पर फ़िट हो जाता है, और 120B एक H100 पर। लेख gpt-oss की तुलना Qwen3 से भी करता है (चौड़ाई और गहराई का संतुलन दर्शाते हुए) और नई GPT-5 की विशेषताओं पर भी चर्चा करता है।
स्रोत: Sebastian Raschka —
मूल
