2025'te Büyük Dil Modellerinin Durumu: İlerlemeler, Zorluklar ve Tahminler
DeepSeek
OpenAI
Alibaba/Qwen
Moonshot AI
NVIDIA
Google/DeepMind
2025 yılında, büyük dil modeli geliştirmesine, DeepSeek R1'in ateşlediği, doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR) ve GRPO algoritmasını kullanan akıl yürütme modelleri hakim oldu. Ana eğilimler arasında çıkarım zamanı ölçeklemesi, MoE mimarileri ve Gated DeltaNets gibi verimlilik iyileştirmeleri yer alıyor. Akademik araştırmalar, sıfır gradyan filtreleme ve token düzeyinde kayıp gibi iyileştirmelerle GRPO varyantlarını vurguladı.
2025 yılı sona ererken, yılın büyük ölçüde DeepSeek R1'in Ocak ayındaki yayınımın ardından RLVR (Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme, Reinforcement Learning with Verifiable Rewards) ve GRPO (Grup İlişkisel Politika Optimizasyonu, Group Relative Policy Optimization) kullanan akıl yürütme modelleri tarafından domine edildiği görüldü. DeepSeek R1, akıl yürütme davranışının pekiştirmeli öğrenme ile geliştirilebileceğini gösterdi ve açık ağırlıklı modeli, özel mülk modellerle karşılaştırılabilir performans sergiledi. Makale ayrıca, son eğitim için yaklaşık 5 milyon dolar olarak tahmin edilen maliyetler üzerinden eğitim maliyetleri tartışmasını alevlendirdi, ancak bu maliyet araştırmacı maaşlarını kapsamıyordu. RLVR, eğitim sonrası süreçte doğrulanabilir ödüller (örneğin matematik, kod) kullanarak pahalı insan etiketlerine olan bağımlılığı azaltır. Her büyük LLM geliştiricisi bir akıl yürütme çeşidi yayınladı. Diğer odak noktaları: 2022 RLHF+PPO (İnsan Geri Bildiriminden Pekiştirmeli Öğrenme + Proksimal Politika Optimizasyonu, Reinforcement Learning from Human Feedback + Proximal Policy Optimization), 2023 LoRA SFT (Düşük Sıralı Adaptasyon ile Denetimli İnce Ayar, Low-Rank Adaptation Supervised Fine-Tuning), 2024 orta eğitim. 2026-2027 için tahminler arasında RLVR uzantıları, çıkarım zamanı ölçekleme ve sürekli öğrenme yer alıyor. GRPO, sıfır gradyan filtreleme, aktif örnekleme, token düzeyinde kayıp ve KL kaybının olmaması gibi eğitim stabilitesini önemli ölçüde iyileştiren birçok matematiksel geliştirmeyle araştırmaların gözdesi haline geldi. Mimari olarak, en son teknoloji modeller hâlâ MoE (Uzmanlar Karışımı, Mixture of Experts) katmanları ve verimlilik için ayarlanmış dikkat mekanizmaları (gruplanmış sorgu, kayan pencere, çok başlı gizli dikkat) ile kodlayıcı-çözücü tarzı dönüştürücüler kullanıyor. Daha yeni verimlilik iyileştirmeleri arasında Qwen3-Next ve Kimi Linear'da Gated DeltaNets ile NVIDIA'nın Nemotron 3'ünde Mamba-2 katmanları bulunuyor.
Kaynak: Sebastian Raschka —
orijinal
