⚡ عاجل
من GPT-2 إلى gpt-oss: تحليل التقدم المعماري والمقارنة مع Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
أصدرت OpenAI نموذجي gpt-oss-120b وgpt-oss-20b، وهما أول نموذجين مفتوحي الأوزان منذ GPT-2. تتميز البنية باستخدام Mixture-of-Experts، وGrouped Query Attention، وRoPE، وSwiGLU، وتحسين MXFP4 للاستدلال المحلي. تسلط المقارنات مع GPT-2 وQwen3 الضوء على التقدم في المفاضلة بين العرض والعمق ونقاط الانتباه الضائعة.
أصدرت OpenAI نموذجي gpt-oss-120b و gpt-oss-20b، وهما أول نموذجين مفتوحَي الأوزان (open-weight) منذ نموذج GPT-2 في عام 2019. يتضمن النموذجان تحسينات معمارية متعددة مقارنة بـ GPT-2: إزالة التسرب (dropout)، واستبدال التضمينات الموضعية المطلقة بـ RoPE (التضمين الموضعي الدوار)، وتغيير دالة التنشيط من GELU إلى SwiGLU، وإضافة خليط من الخبراء (MoE)، واستخدام الاستعلام الجماعي المُجمّع (GQA). يزيد MoE من إجمالي المعاملات لكنه يُفعّل مجموعة فرعية فقط لكل رمز (token)، مما يُبقي الاستدلال (inference) فعالاً. يُقلّل GQA من رؤوس المفاتيح-القيم (key-value heads) لخفض استخدام الذاكرة. يستخدم النموذجان تحسين MXFP4 ليتناسبا مع وحدات معالجة رسوميات (GPU) مفردة (20 مليار معلمة على GPU استهلاكي بسعة 16 جيجابايت، و120 مليار معلمة على H100 بسعة 80 جيجابايت). بالمقارنة مع Qwen3، يستكشف gpt-oss المفاضلات بين العرض والعمق. كما يُناقش التحيز والانزلاق الانتباهي (attention bias and sinks). يذكر المقال أيضًا نموذج GPT-5 بإيجاز. تُظهر الاختبارات المعيارية أداءً تنافسيًا، رغم عدم تقديم نتائج مفصلة.
المصدر: Sebastian Raschka —
الأصلي
