RL zonder TD-leren: Nieuw verdeel-en-heersalgoritme
Berkeley Artificial Intelligence Research (BAIR)
Onderzoekers stellen Transitive RL (TRL) voor, een nieuw verdeel-en-heersalgoritme voor reinforcement learning dat temporal difference-leren vermijdt. TRL schaalt naar taken met een lange horizon door trajecten recursief op te splitsen en behaalt state-of-the-art resultaten op uitdagende benchmarks zonder dat de stap parameter n hoeft te worden afgesteld.
Er is een nieuw reinforcement learning-algoritme geïntroduceerd genaamd Transitive RL (TRL), gebaseerd op een verdeel-en-heersparadigma in plaats van traditioneel ‘temporal difference’ (TD)-leren. TD-leren lijdt onder foutenaccumulatie over lange tijdsintervallen, en hoewel n-staps TD dit lineair vermindert, vereist het zorgvuldige afstemming van n. TRL vermindert het aantal Bellman-recursies logaritmisch door trajecten recursief te splitsen in gelijke segmenten en hun waarden te combineren. In de praktijk beperkt TRL subdoelzoekopdrachten tot dataset-toestanden en gebruikt het ‘expectile’-regressie om overschatting te voorkomen. Geëvalueerd op de moeilijkste ‘humanoidmaze’- en ‘puzzle’-taken van OGBench (tot 3000 stappen), behaalde TRL de beste prestaties onder sterke basislijnen en evenaarde het de best individueel afgestemde n-staps TD zonder dat n-afstemming nodig was. De methode neemt momenteel deterministische dynamiek aan en is beperkt tot doelgeconditioneerd ‘reinforcement learning’, maar toekomstig werk kan zich uitbreiden naar op beloning gebaseerde taken en stochastische omgevingen.
Bron: BAIR (Berkeley AI) —
origineel
