Amazon Nova Forge ile Çok Turlu Pekiştirmeli Öğrenme için Özel Ödül Fonksiyonları
Amazon/AWS
Amazon Nova Forge, çok turlu pekiştirmeli öğrenme için özel ödül fonksiyonları sağlar; ekiplerin iyi bir sonucun neye benzediğini tanımlamasına olanak tanırken hizmet, roll-out'ları ve konuşma durumunu koordine eder. Gönderi, GRPO için bileşik çok turlu ödüller tasarlamayı, model tarafından üretilen kodu güvenli bir şekilde yürütmeyi ve ödül sinyalini çökerebilecek tuzakları kapsar.
Çok turlu pekiştirmeli öğrenmede (RL), özel ödül fonksiyonu modelin ne öğreneceğini belirler ve ince bir şekilde yanlış ayarlanmış bir ödül, sağlıklı eğitim eğrilerine rağmen yanlış şeyi öğretebilir. Amazon Nova Forge, ödül mantığını Kendi Orkestrasyonunuzu Getirin (BYOO) aracılığıyla kendi ortamınızda çalıştırır; sunucusuz çok turlu RL seçeneği artık genel olarak kullanılabilir. Bu yazı, Grup Göreli Politika Optimizasyonu'nun (GRPO) öğrenebileceği kompozit bir çok turlu ödül tasarlamaya odaklanır; buna, çok turlu işbirlikçi kodlama görevinde Amazon Nova Lite 2.0'a kodlamadan önce sormayı öğretme örneği de dahildir. Örnekte dört bileşenli bir ödül kullanılır: doğruluk, kodlamadan_önce_sordu, hemen_tahmin_etti ve döngü_cezası. Ayrıca, kimlik bilgilerini veya ağı ifşa etmeme, kaynak sınırları uygulama ve test sayısını doğrulama gibi önlemlerle model tarafından üretilen kodu güvenli bir şekilde çalıştırmayı da kapsar. Tuzaklar bölümü, ödül hack'leme, eğitim istikrarsızlığı ve ödül çöküşünü tartışır; bir ödül sinyalinin öğrenmeyi yalnızca grup içindeki varyasyon yoluyla etkilediğini, bu nedenle her tamamlama için aynı değeri alan bir terimin gradyana hiçbir katkı sağlamadığını vurgular. İstenen davranışların kapılarını açmanın ve başarısızlık modlarını cezalandırmanın önemi vurgulanır; ayrıca eğitimin ne öğrendiğine güvenmek için her bir bileşeni ölçmenin gerekliliği belirtilir.
Kaynak: AWS ML blog —
orijinal
