RechercheAgents 🇺🇸 27.07.2026 15:05

GRASP : Un nouveau planificateur basé sur le gradient pour la planification à long terme dans les modèles du monde

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Des chercheurs du BAIR proposent GRASP, un planificateur basé sur le gradient qui répond aux défis de la planification à long terme avec des modèles du monde appris. Il élève l'optimisation de trajectoire à des états virtuels parallèles, introduit de la stochasticité pour l'exploration et remodèle les gradients pour éviter les gradients fragiles état-entrée.
GRASP est un nouveau planificateur basé sur le gradient pour les dynamiques apprises (modèles du monde) qui rend la planification à long terme pratique en (1) relevant la trajectoire dans des états virtuels afin que l'optimisation soit parallélisée dans le temps, (2) ajoutant directement de la stochasticité aux itérations d'état pour l'exploration, et (3) remodelant les gradients de sorte que les actions reçoivent des signaux clairs tout en évitant les gradients fragiles 'état-entrée' à travers des modèles de vision en haute dimension. Les grands modèles du monde appris deviennent de plus en plus performants, mais la planification à long terme reste fragile en raison de graphes de calcul mal conditionnés, de paysages non convexes avec de mauvais minima locaux, et d'espaces latents en haute dimension introduisant des modes de défaillance subtils. Les auteurs de BAIR, avec Mike Rabbat, Aditi Krishnapriyan, Yann LeCun et Amir Bar, proposent GRASP pour résoudre ces problèmes. Le planificateur construit une approche d'état relevé du premier ordre qui ne dépend que des jacobiennes des actions à travers le modèle du monde, exploitant la différentiabilité tout en évitant la sensibilité des jacobiennes d'état.
Source: BAIR (Berkeley AI) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches