⚡ EN DIRECT
De GPT-2 à gpt-oss : Analyse des avancées architecturales et comparaison avec Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI a publié gpt-oss-120b et gpt-oss-20b, leurs premiers modèles open-weight depuis GPT-2. L'architecture intègre Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU et l'optimisation MXFP4 pour l'inférence locale. Les comparaisons avec GPT-2 et Qwen3 mettent en évidence les progrès dans les compromis largeur vs profondeur et les puits d'attention.
OpenAI a publié gpt-oss-120b et gpt-oss-20b, leurs premiers LLMs open-weight depuis GPT-2 en 2019. Les modèles intègrent plusieurs améliorations architecturales par rapport à GPT-2 : suppression du dropout, remplacement des embeddings positionnels absolus par RoPE, passage de l'activation GELU à SwiGLU, ajout de Mixture-of-Experts (MoE), et utilisation de Grouped Query Attention. MoE augmente le nombre total de paramètres mais n'en active qu'un sous-ensemble par token, ce qui maintient l'efficacité de l'inférence. GQA réduit les têtes clé-valeur pour diminuer l'utilisation mémoire. Les modèles utilisent l'optimisation MXFP4 pour tenir sur des GPU uniques (20B sur un GPU grand public de 16 Go, 120B sur H100 80 Go). Par rapport à Qwen3, gpt-oss explore les compromis entre largeur et profondeur. Les biais d'attention et les sinks sont également abordés. L'article mentionne brièvement GPT-5 en contexte. Les benchmarks montrent des performances compétitives, bien que les scores détaillés ne soient pas fournis.
Source: Sebastian Raschka —
original
