⚡ BREAKING
Dari GPT-2 ke gpt-oss: Menganalisis Kemajuan Arsitektur dan Perbandingan dengan Qwen3
OpenAI
Alibaba/Qwen
Meta
Google/DeepMind
AI21 Labs
Tencent
OpenAI merilis gpt-oss-120b dan gpt-oss-20b, model open-weight pertama mereka sejak GPT-2. Arsitektur ini menampilkan Mixture-of-Experts, Grouped Query Attention, RoPE, SwiGLU, dan optimasi MXFP4 untuk inferensi lokal. Perbandingan dengan GPT-2 dan Qwen3 menyoroti kemajuan dalam trade-off lebar versus kedalaman dan attention sinks.
OpenAI merilis gpt-oss-120b dan gpt-oss-20b, model bahasa bersumber terbuka pertama mereka sejak GPT-2 pada tahun 2019. Model-model ini menggabungkan beberapa peningkatan arsitektural dibandingkan GPT-2: menghapus dropout, mengganti embedding posisional absolut dengan RoPE, mengganti aktivasi dari GELU menjadi SwiGLU, menambahkan Mixture-of-Experts (MoE), dan menggunakan Grouped Query Attention. MoE meningkatkan total parameter tetapi hanya mengaktifkan subset per token, menjaga efisiensi inferensi. GQA mengurangi key-value heads untuk menurunkan penggunaan memori. Model-model ini menggunakan optimasi MXFP4 agar dapat muat di GPU tunggal (20B di GPU konsumen 16GB, 120B di H100 80GB). Dibandingkan dengan Qwen3, gpt-oss mengeksplorasi trade-off antara lebar dan kedalaman. Bias atensi dan sink juga dibahas. Artikel ini juga secara singkat menyebutkan GPT-5 dalam konteksnya. Tolok ukur menunjukkan performa yang kompetitif, meskipun skor detail tidak disediakan.
Sumber: Sebastian Raschka —
asli
