AraştırmaAçık Kaynak 🇺🇸 12.08.2026 21:03

AllenAI Open Instruct Tulu 3 Eğitim Sonrası: SFT, DPO, RLVR, GRPO ve Doğrulayıcı Tabanlı Değerlendirme

AllenAIAllenAI
Bu öğretici, AllenAI'nin Open Instruct çerçevesini kullanarak bir dil modeli için uçtan uca eğitim sonrası ardışık düzenini gösterir ve 16 GB GPU'da çalışacak şekilde uyarlanmıştır. Denetimli İnce Ayar (SFT), Doğrudan Tercih Optimizasyonu (DPO) ve GRPO kullanarak Doğrulanabilir Ödüllerle Takviyeli Öğrenmeyi (RLVR) kapsar; matematiksel yanıtları değerlendirmek için deterministik doğrulayıcılar içerir.
Bu eğitim, AllenAI'nin Open Instruct çerçevesini kullanarak kompakt bir talimat ayarlı dil modeli oluşturmayı adım adım anlatır. Süreç, üç eğitim aşamasını içerir: Denetimli İnce Ayar (SFT), Doğrudan Tercih Optimizasyonu (DPO) ve GRPO kullanarak Doğrulanabilir Ödüllerle Pekiştirmeli Öğrenme (RLVR); tümü 16 GB çalışma zamanına uyacak şekilde uyarlanmıştır. Uygulama, Open Instruct deposundan yararlanır ve DPO kaybı, GRPO kaybı ve log-olasılık hesaplamaları gibi işlevleri seçici olarak yükler. LoRA adaptörleri yapılandırılır ve her aşama için GSM8K verisi hazırlanır. Belirleyici doğrulayıcılar (GSM8K, Math, IFEval), üretilen matematiksel yanıtları puanlamak için kullanılır. vLLM, Ray aktörleri ve DeepSpeed gibi dağıtık bileşenler, Colab için uygun hafif Hugging Face ve PyTorch uygulamalarıyla değiştirilir. Kullanılan model Qwen2.5-0.5B-Instruct'tir.
Kaynak: MarkTechPost — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler