AraştırmaModeller 🇺🇸 27.07.2026 18:04

SRPO: Kuaishou'un Yeni RL Yöntemi, LLM Eğitiminde GRPO'dan 10 Kat Daha Verimli

Kuaishou'un Kwaipilot ekibindeki araştırmacılar, matematik ve kod alanlarında DeepSeek-R1-Zero seviyesinde performansa eğitim adımlarının yalnızca onda biriyle ulaşan iki aşamalı bir pekiştirmeli öğrenme çerçevesi olan SRPO'yu tanıttı. SRPO, aşamalı eğitim ve geçmiş yeniden örnekleme yoluyla çapraz alan optimizasyon çatışmalarını, düşük örnek verimliliğini ve erken doygunluğu ele alıyor.
Kuaishou'nun Kwaipilot ekibi, standart GRPO'yu geride bırakan bir büyük dil modeli pekiştirmeli öğrenme çerçevesi olan SRPO'yu (İki Aşamalı Geçmiş Yeniden Örnekleme Politika Optimizasyonu) geliştirdi. SRPO, iki aşamalı bir eğitim paradigması kullanır: ilk olarak, muhakeme becerisini ortaya çıkarmak için zorlu matematik verileri üzerinde eğitim; ardından beceri birleştirme için kod verilerini entegre etme. Geçmiş Yeniden Örnekleme, sıfır ödül varyansına sahip kolay örnekleri filtreleyerek etkili gradyan güncellemeleri sağlar. Deneyler, SRPO-Qwen-32B'nin AIME24'te 50 ve LiveCodeBench'te 41.6 puan aldığını, DeepSeek-R1-Zero-32B ile karşılaştırılabilir olduğunu ancak 10 kat daha az eğitim adımı gerektirdiğini göstermektedir. Model, yeniden kontrol etme, tereddüt etme ve keşfetme gibi yansıtıcı davranışlar sergiler ve matematik çözümlerini doğrulamak için kendiliğinden kod kullanır. Ekip, modeli açık kaynak olarak yayınladı ve bir teknik rapor yayımladı.
Kaynak: Synced — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler