RL sin aprendizaje TD: Un nuevo algoritmo de 'divide y vencerás'
Investigadores de BAIR (Berkeley AI) han presentado el algoritmo Transitive RL (TRL), basado en un paradigma de 'divide y vencerás' para el aprendizaje por refuerzo off-policy. TRL reduce logarítmicamente el número de recursiones de Bellman, evitando los problemas de acumulación de errores típicos del aprendizaje TD. El algoritmo mostró resultados superiores en tareas complejas de largo horizonte sin necesidad de ajustar el hiperparámetro n como en el TD de n pasos.
Berkeley Artificial Intelligence Research (BAIR)
