⚡ BREAKING
ModellenOnderzoek 🇺🇸 27.07.2026 18:03

Van GPT-2 tot gpt-oss: Analyse van architectonische vooruitgang en vergelijking met Qwen3

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI heeft gpt-oss-120b en gpt-oss-20b uitgebracht, hun eerste open-weight modellen sinds GPT-2. De architectuur bevat Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU en MXFP4-optimalisatie voor lokale inferentie. Vergelijkingen met GPT-2 en Qwen3 benadrukken vooruitgang in afwegingen tussen breedte en diepte en attention sinks.
OpenAI heeft gpt-oss-120b en gpt-oss-20b uitgebracht, de eerste open-gewichts LLM's sinds GPT-2 in 2019. De modellen bevatten verschillende architectuurverbeteringen ten opzichte van GPT-2: het verwijderen van dropout, het vervangen van absolute positionele embeddings door RoPE, het wijzigen van de activatie van GELU naar SwiGLU, het toevoegen van Mixture-of-Experts (MoE), en het gebruik van Grouped Query Attention. MoE verhoogt het totale aantal parameters, maar activeert slechts een subset per token, waardoor de inferentie efficiënt blijft. GQA vermindert het aantal key-value heads om het geheugengebruik te verlagen. De modellen gebruiken MXFP4-optimalisatie om op één enkele GPU te passen (20B op een 16GB consumenten-GPU, 120B op een H100 80GB). Vergeleken met Qwen3 onderzoekt gpt-oss afwegingen tussen breedte en diepte. Attention bias en sinks worden ook besproken. In het artikel wordt ook kort GPT-5 vermeld in de context. Benchmarks tonen concurrerende prestaties, hoewel gedetailleerde scores niet worden gegeven.
Bron: Sebastian Raschka — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws