GRASP: Nuevo Planificador Basado en Gradientes para Planificación a Largo Plazo en Modelos del Mundo
Berkeley Artificial Intelligence Research (BAIR)
Investigadores de BAIR proponen GRASP, un planificador basado en gradientes que aborda los desafíos de la planificación a largo plazo con modelos del mundo aprendidos. Eleva la optimización de trayectorias a estados virtuales paralelos, introduce estocasticidad para la exploración y remodela los gradientes para evitar gradientes frágiles de entrada de estado.
GRASP es un nuevo planificador basado en gradientes para dinámicas aprendidas (modelos del mundo) que hace práctico el planeamiento a largo plazo mediante: (1) elevar la trayectoria a estados virtuales para optimizar en paralelo a través del tiempo, (2) añadir estocasticidad directamente a las iteraciones de estado para exploración, y (3) remodelar los gradientes para que las acciones reciban señales limpias evitando gradientes frágiles de 'entrada de estado' a través de modelos de visión de alta dimensión. Los modelos del mundo aprendidos a gran escala son cada vez más capaces, pero el planeamiento a largo plazo sigue siendo frágil debido a grafos computacionales mal condicionados, paisajes no codiciosos con malos mínimos locales y espacios latentes de alta dimensión que introducen modos de fallo sutiles. Los autores de BAIR, junto con Mike Rabbat, Aditi Krishnapriyan, Yann LeCun y Amir Bar, proponen GRASP para abordar estos problemas. El planificador construye un enfoque de estado elevado de primer orden que depende únicamente de los jacobianos de acción a través del modelo del mundo, explotando la diferenciabilidad mientras evita la sensibilidad de los jacobianos de estado.
Fuente: BAIR (Berkeley AI) —
original
