RL ohne TD-Lernen: Neuer Divide-and-Conquer-Algorithmus
Berkeley Artificial Intelligence Research (BAIR)
Forscher schlagen Transitives RL (TRL) vor, einen neuen Divide-and-Conquer-Verstärkungslernalgorithmus, der das zeitliche Differenzlernen vermeidet. TRL skaliert auf langfristige Aufgaben, indem es Trajektorien rekursiv aufteilt, und erzielt hochmoderne Ergebnisse auf anspruchsvollen Benchmarks, ohne den Schrittparameter n abstimmen zu müssen.
Ein neuer Reinforcement-Learning-Algorithmus namens Transitive RL (TRL) wurde vorgestellt, der auf einem Divide-and-Conquer-Paradigma basiert und nicht auf dem traditionellen Temporal-Difference-Learning (TD-Learning). TD-Learning leidet unter Fehlerakkumulation über lange Horizonte, und während n-Schritt-TD dies linear reduziert, erfordert es eine sorgfältige Abstimmung von n. TRL reduziert die Anzahl der Bellman-Rekursionen logarithmisch, indem es Trajektorien rekursiv in gleich lange Segmente aufteilt und deren Werte kombiniert. Praktisch schränkt TRL die Subzielsuche auf Datenatzustände ein und verwendet Expectile-Regression, um Überschätzung zu vermeiden. Evaluiert auf den schwierigsten Humanoidmaze- und Puzzle-Aufgaben von OGBench (bis zu 3000 Schritte), erzielte TRL die beste Leistung unter starken Basislinien und erreichte die Ergebnisse des besten individuell abgestimmten n-Schritt-TD, ohne dass eine Abstimmung von n erforderlich war. Die Methode geht derzeit von deterministischen Dynamiken aus und ist auf zielbedingtes Reinforcement-Learning beschränkt, aber zukünftige Arbeiten könnten auf belohnungsbasierte Aufgaben und stochastische Umgebungen ausgeweitet werden.
Quelle: BAIR (Berkeley AI) —
Original
