Pesquisa 🇺🇸 27.07.2026 17:04

RL sem Aprendizagem TD: Um Novo Algoritmo 'Dividir e Conquistar'

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Pesquisadores do BAIR (Berkeley AI) introduziram o algoritmo Transitive RL (TRL), baseado em um paradigma de 'dividir e conquistar' para aprendizado por reforço (RL) fora da política. O TRL reduz logaritmicamente o número de recorrências de Bellman, evitando os problemas de acúmulo de erro típicos do aprendizado TD. O algoritmo mostrou resultados superiores em tarefas complexas de horizonte longo sem exigir ajuste do hiperparâmetro n como no TD de n etapas.
O blog do BAIR (Berkeley AI Research) apresentou o algoritmo Transitive RL (TRL), que implementa o paradigma de dividir para conquistar no aprendizado por reforço (RL, do inglês Reinforcement Learning) fora da política. Diferentemente dos métodos tradicionais baseados no aprendizado por diferença temporal (TD, do inglês Temporal Difference), o TRL divide a trajetória em duas partes iguais e atualiza o valor de todo o caminho por meio de uma combinação dos valores das metades, reduzindo o número de recursões de Bellman logaritmicamente, em vez de linearmente. Isso resolve o problema de acúmulo de erros enfrentado pelo aprendizado TD em tarefas de horizonte longo. O algoritmo concentra-se no RL condicionado a objetivos (goal-conditioned RL). Para encontrar o subobjetivo (subgoal) ótimo w, o estado é restrito ao conjunto de dados, e o operador max é substituído por um soft-argmax via regressão expectil, prevenindo a superestimação de valores. O TRL foi testado em tarefas complexas do OGBench (humanoidmaze, puzzle) com horizonte de até 3000 passos. Os resultados mostram que o TRL supera fortes métodos de base (TD, MC, aprendizado quase-métrico) e atinge o desempenho do melhor TD de n-passos ajustado individualmente, sem a necessidade de ajustar n. Os autores planejam expandir o TRL para tarefas comuns de RL com recompensas e ambientes estocásticos.
Fonte: BAIR (Berkeley AI) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas