⚡ SON DAKİKA
ModellerAraştırma 🇺🇸 27.07.2026 18:03

GPT-2'den gpt-oss'a: Mimari Gelişmelerin Analizi ve Qwen3 ile Karşılaştırma

OpenAIOpenAI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind AI21 LabsAI21 Labs TencentTencent
OpenAI, GPT-2'den bu yana ilk açık ağırlıklı modelleri olan gpt-oss-120b ve gpt-oss-20b'yi yayınladı. Mimari, Uzman Karışımı (Mixture-of-Experts), Gruplanmış Sorgu Dikkati (Grouped Query Attention), RoPE, SwiGLU ve yerel çıkarım için MXFP4 optimizasyonunu içeriyor. GPT-2 ve Qwen3 ile yapılan karşılaştırmalar, genişlik ve derinlik arasındaki ödünleşimler ile dikkat bataklıkları (attention sinks)ndaki ilerlemeleri vurguluyor.
OpenAI, 2019'daki GPT-2'den bu yana ilk açık ağırlıklı büyük dil modelleri olan gpt-oss-120b ve gpt-oss-20b'yi yayınladı. Modeller, GPT-2'ye kıyasla birkaç mimari iyileştirme içeriyor: dropout'un kaldırılması, mutlak konumsal yerleştirmelerin yerini Döner Konum Yerleştirmeleri (Rotary Position Embeddings - RoPE) alması, aktivasyon fonksiyonunun GELU'dan SwiGLU'ya değiştirilmesi, Uzmanlar Karışımı (Mixture-of-Experts - MoE) eklenmesi ve Gruplanmış Sorgu Dikkati (Grouped Query Attention - GQA) kullanılması. MoE, toplam parametre sayısını artırır ancak token başına yalnızca bir alt kümesini etkinleştirerek çıkarımı verimli tutar. GQA, bellek kullanımını azaltmak için anahtar-değer başlıklarını düşürür. Modeller, tek GPU'lara sığmak için MXFP4 optimizasyonu kullanır (20B, 16 GB tüketici GPU'sunda; 120B, H100 80GB'de). Qwen3 ile karşılaştırıldığında, gpt-oss genişlik ve derinlik arasındaki ödünleşimleri araştırır. Dikkat önyargısı ve batma noktaları da tartışılmaktadır. Makale ayrıca bağlamda kısaca GPT-5'ten de bahseder. Kıyaslamalar, ayrıntılı puanlar verilmese de rekabetçi performans gösterir.
Kaynak: Sebastian Raschka — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler