RL ilman TD-oppimista: Uusi jako-ja-hallitse -algoritmi
Berkeley Artificial Intelligence Research (BAIR)
Tutkijat ehdottavat Transitive RL (TRL) -algoritmia, uutta jako-ja-hallitse -vahvistusoppimismenetelmää, joka välttää temporaalisen differenssin oppimisen. TRL skaalautuu pitkäjänteisiin tehtäviin jakamalla reitit rekursiivisesti osiin ja saavuttaa huipputuloksia haastavilla vertailutasoilla ilman tarvetta virittää askelparametri n.
Uusi vahvistusoppimisen (reinforcement learning, RL) algoritmi nimeltä Transitive RL (TRL) on esitelty. Se perustuu hajota ja hallitse -periaatteeseen perinteisen aikaeroa (temporal difference, TD) hyödyntävän oppimisen sijaan. TD-oppiminen kärsii virheiden kasautumisesta pitkillä aikaväleillä, ja vaikka n-askeleen TD vähentää tätä lineaarisesti, se vaatii parametrin n huolellista virittämistä. TRL vähentää Bellmanin rekursioiden määrää logaritmisesti jakamalla trajektorit rekursiivisesti yhtä pitkiin segmentteihin ja yhdistämällä niiden arvot. Käytännössä TRL rajaa alitavoitteiden haun datajoukon tiloihin ja käyttää expektiiliregressiota estääkseen yliarvioinnin. Menetelmää testattiin OGBenchin vaikeimmilla humanoidmaze- ja puzzle-tehtävillä (jopa 3000 askelta), ja TRL saavutti parhaan suorituskyvyn vahvojen vertailumenetelmien joukossa sekä ylsi parhaan yksilöllisesti viritetyn n-askeleen TD:n tasolle ilman, että n:ää tarvitsi virittää. Menetelmä olettaa toistaiseksi deterministisen dynamiikan ja rajoittuu tavoite-ehdolliseen RL:ään, mutta tulevaisuudessa sitä voitaisiin laajentaa palkkioperusteisiin tehtäviin ja stokastisiin ympäristöihin.
Lähde: BAIR (Berkeley AI) —
Alkuperäinen
