RL ohne TD-Lernen: Neuer Divide-and-Conquer-Algorithmus
Forscher schlagen Transitives RL (TRL) vor, einen neuen Divide-and-Conquer-Verstärkungslernalgorithmus, der das zeitliche Differenzlernen vermeidet. TRL skaliert auf langfristige Aufgaben, indem es Trajektorien rekursiv aufteilt, und erzielt hochmoderne Ergebnisse auf anspruchsvollen Benchmarks, ohne den Schrittparameter n abstimmen zu müssen.
Berkeley Artificial Intelligence Research (BAIR)








