GRASP: Novo Planejador Baseado em Gradiente para Planejamento de Longo Horizonte em Modelos de Mundo
Berkeley Artificial Intelligence Research (BAIR)
Pesquisadores do BAIR propõem o GRASP, um planejador baseado em gradiente que aborda desafios no planejamento de longo horizonte com modelos de mundo aprendidos. Ele eleva a otimização de trajetória para estados virtuais paralelos, introduz estocasticidade para exploração e remodela gradientes para evitar gradientes frágeis de estado-entrada.
GRASP é um novo planejador baseado em gradientes para dinâmicas aprendidas (modelos de mundo) que torna o planejamento de longo horizonte prático ao: (1) elevar a trajetória para estados virtuais, de modo que a otimização seja paralela ao longo do tempo; (2) adicionar estocasticidade diretamente às iterações de estado para exploração; e (3) remodelar os gradientes para que as ações recebam sinais limpos, evitando gradientes frágeis de 'estado-entrada' por meio de modelos de visão de alta dimensão. Grandes modelos de mundo aprendidos estão se tornando cada vez mais capazes, mas o planejamento de longo horizonte permanece frágil devido a grafos computacionais mal condicionados, paisagens não convexas com mínimos locais ruins e espaços latentes de alta dimensão que introduzem modos de falha sutis. Os autores do BAIR (Berkeley Artificial Intelligence Research), incluindo Mike Rabbat, Aditi Krishnapriyan, Yann LeCun e Amir Bar, propõem o GRASP para lidar com essas questões. O planejador constrói uma abordagem de estado elevado de primeira ordem que depende apenas dos Jacobianos das ações através do modelo de mundo, explorando a diferenciabilidade enquanto evita a sensibilidade dos Jacobianos de estado.
Fonte: BAIR (Berkeley AI) —
original
