RL sem Aprendizagem TD: Um Novo Algoritmo 'Dividir e Conquistar'
Pesquisadores do BAIR (Berkeley AI) introduziram o algoritmo Transitive RL (TRL), baseado em um paradigma de 'dividir e conquistar' para aprendizado por reforço (RL) fora da política. O TRL reduz logaritmicamente o número de recorrências de Bellman, evitando os problemas de acúmulo de erro típicos do aprendizado TD. O algoritmo mostrou resultados superiores em tarefas complexas de horizonte longo sem exigir ajuste do hiperparâmetro n como no TD de n etapas.
Berkeley Artificial Intelligence Research (BAIR)
