Araştırma 🇺🇸 27.07.2026 17:04

TD Öğrenmesi Olmadan Pekiştirmeli Öğrenme: Yeni Böl ve Fethet Algoritması

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Araştırmacılar, zamansal fark öğrenmesinden kaçınan yeni bir böl ve fethet pekiştirmeli öğrenme algoritması olan Geçişli Pekiştirmeli Öğrenmeyi (TRL) öneriyor. TRL, yörüngeleri yinelemeli olarak bölerek uzun ufuklu görevlere ölçekleniyor ve adım parametresi n'yi ayarlamaya gerek kalmadan zorlu kıyaslamalarda son teknoloji sonuçlar elde ediyor.
Transitive RL (TRL) adlı yeni bir pekiştirmeli öğrenme algoritması tanıtıldı. Bu algoritma, geleneksel zamansal fark (temporal difference, TD) öğrenmesi yerine böl ve yönet paradigmasına dayanıyor. TD öğrenmesi, uzun ufuklarda hata birikiminden muzdariptir; n-adımlı TD bu hatayı doğrusal olarak azaltsa da, n'nin dikkatli bir şekilde ayarlanmasını gerektirir. TRL, yörüngeleri eşit uzunluktaki parçalara yinelemeli olarak bölüp değerlerini birleştirerek Bellman özyineleme sayısını logaritmik olarak azaltır. Pratikte TRL, alt amaç aramayı veri kümesi durumlarıyla sınırlandırır ve aşırı tahminlemeyi önlemek için beklenti kuantil regresyonu (expectile regression) kullanır. OGBench'in en zor insansı labirent (humanoidmaze) ve bulmaca (puzzle) görevlerinde (3000 adıma kadar) değerlendirilen TRL, güçlü temel yöntemler arasında en iyi performansı elde etmiş ve n ayarı gerektirmeden en iyi bireysel olarak ayarlanmış n-adımlı TD ile eşleşmiştir. Yöntem şu anda deterministik dinamikler varsaymakta ve yalnızca hedef koşullu pekiştirmeli öğrenme ile sınırlıdır, ancak gelecekteki çalışmalar ödül tabanlı görevlere ve stokastik ortamlara genişletilebilir.
Kaynak: BAIR (Berkeley AI) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler