Büyük Dil Modellerinde Muhakeme Seviyelerini Yönetme
OpenAI
DeepSeek
Moonshot AI
Makale, DeepSeek-R1 ve GPT-5.6 gibi muhakeme modellerinin, doğrulanabilir ödüllerle pekiştirmeli öğrenme (RLVR) yoluyla nasıl muhakeme izleri üretmeyi öğrendiğini açıklıyor. Eğitim sürecini, çıkarım ölçeklemesini, düşünce token'larını ve muhakeme çaba modlarının (düşük/orta/yüksek) denetimli ince ayar ve tokenleştirici değişimleri yoluyla nasıl uygulandığını detaylandırıyor.
OpenAI o1'i piyasaya sürmesinden bu yana, ara muhakeme izleri üreten muhakeme modelleri standart hale geldi. DeepSeek-R1, RLVR eğitimini popüler hale getirdi; bu yöntemde, bir model matematik ve kod görevlerinde doğru cevaplar için ödüllendirilirken, muhakeme izinin kendisi güncellemeler için kullanılmaz. Bu, modellerin kendi kendini düzeltmeyi öğrendiği 'Aha' anlarına yol açtı. Kimi K1.5 ve Tülu 3 de bu yaklaşıma katkıda bulundu; R1-Zero ise saf RLVR'nin muhakeme öğretebileceğini gösterdi. Çoğunluk oylaması yoluyla öz-tutarlılık gibi çıkarım ölçeklendirmesi performansı daha da artırıyor. Düşünce tokenleri (<think></think>), muhakemeyi yanıtlardan ayırmak için kozmetik işaretleyicilerdir ve muhakeme için gerekli değildir. Muhakeme modu geçişleri (açık/kapalı), düşünceli ve düşüncesiz örneklerle denetimli ince ayar yoluyla uygulanır ve takviyeli öğrenme sırasında pekiştirilir. GPT-5.6 gibi modellerdeki muhakeme çabası ayarları (düşük/orta/yüksek), muhtemelen yanıt uzunluğunu ve doğruluğunu kontrol eder; bu, OpenAI'nin gpt-oss modellerinde görüldüğü gibi, sistem istemleri aracılığıyla yapılıyor olabilir.
Kaynak: Sebastian Raschka —
orijinal
