DeepSeek, R2 modeline işaret ediyor ve yeni çıkarım ölçeklendirme yöntemi SPCT'yi tanıtıyor
DeepSeek
OpenAI
DeepSeek AI, genel ödül modelleri için çıkarım zamanı ölçeklendirme üzerine bir makale yayımlayarak SPCT'yi (Kendi Kendini İlkeli Eleştiri Ayarı) tanıttı. Şirket, yaklaşan R2 modeline işaret ediyor. Araştırma, ödül seyrekliği sorununu ele alıyor ve çıkarım sırasında ödül modellerinin ölçeklenebilirliğini iyileştirmeyi hedefliyor.
DeepSeek AI, 'Çıkarım Zamanı Ölçeklemesi ile Genel Amaçlı Ödül Modellemesi' başlıklı bir makale yayınlayarak Kendi İlkesini Belirleyen Eleştiri Ayarlaması (Self-Principled Critique Tuning - SPCT) adlı yeni bir yöntemi tanıttı. SPCT, reddetme ince ayarı ve kural tabanlı çevrimiçi pekiştirmeli öğrenme yoluyla dinamik olarak ilkeler ve eleştiriler üreterek genel ödül modellerini (General Reward Models - GRM'ler) geliştiriyor. Bu yaklaşım, çıkarım sırasında ölçeklenebilirliği artırmayı ve büyük dil modelleri (Large Language Models - LLM'ler) için pekiştirmeli öğrenmeyi ölçeklendirmede büyük bir engel olan ödül seyrekliği sorununu ele almayı hedefliyor. DeepSeek'in R1 serisi, saf pekiştirmeli öğrenme eğitimini zaten doğrulamıştı; şirket şimdi bu ilerlemelerin üzerine inşa edilmesi beklenen bir sonraki nesil R2 modeline işaret ediyor. LLM ölçeklendirmesinde ön eğitimden eğitim sonrasına, özellikle çıkarım aşamasına doğru olan kayma, kapsamlı iç düşünce zinciri muhakemesi kullanan OpenAI'ın o1 gibi modelleri takip ediyor.
Kaynak: Synced —
orijinal
