GRASP: Yeni Gradyan Tabanlı Planlayıcı ile Dünya Modellerinde Uzun Süreli Planlama
Berkeley Artificial Intelligence Research (BAIR)
BAIR'den araştırmacılar, öğrenilmiş dünya modelleriyle uzun süreli planlamadaki zorlukları ele alan gradyan tabanlı bir planlayıcı olan GRASP'ı öneriyor. Yörünge optimizasyonunu paralel sanal durumlara yükseltiyor, keşif için stokastiklik getiriyor ve kırılgan durum-girdi gradyanlarından kaçınmak için gradyanları yeniden şekillendiriyor.
GRASP, öğrenilmiş dinamikler (dünya modelleri) için yeni bir gradyan tabanlı planlayıcıdır ve uzun ufuklu planlamayı (1) yörüngeyi sanal durumlara yükselterek optimizasyonun zaman boyunca paralel hale gelmesini sağlayarak, (2) doğrudan durum yinelemelerine keşif için rastgelelik ekleyerek ve (3) gradyanları yeniden şekillendirerek eylemlerin temiz sinyaller almasını ve yüksek boyutlu görme modelleri aracılığıyla kırılgan 'durum-girdi' gradyanlarından kaçınmasını sağlayarak pratik hale getirir. Büyük öğrenilmiş dünya modelleri giderek daha yetenekli hale geliyor ancak uzun ufuklu planlama, kötü koşullandırılmış hesaplama grafikleri, kötü yerel minimumlara sahip açgözlü olmayan manzaralar ve ince başarısızlık modları ortaya çıkaran yüksek boyutlu gizli uzaylar nedeniyle kırılgan olmaya devam ediyor. BAIR'den Mike Rabbat, Aditi Krishnapriyan, Yann LeCun ve Amir Bar'ın da aralarında bulunduğu yazarlar, bu sorunları ele almak için GRASP'ı öneriyor. Planlayıcı, yalnızca dünya modeli aracılığıyla eylem Jacobian matrislerine bağlı birinci dereceden yükseltilmiş durum yaklaşımı oluşturur, türevlenebilirlikten yararlanırken durum Jacobian matrislerinin hassasiyetinden kaçınır.
Kaynak: BAIR (Berkeley AI) —
orijinal
