Recherche 🇺🇸 27.07.2026 17:04

RL sans apprentissage TD : un nouvel algorithme diviser pour régner

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
Des chercheurs proposent l'apprentissage par renforcement transitif (TRL), un nouvel algorithme de renforcement par renforcement diviser pour régner qui évite l'apprentissage par différence temporelle. TRL passe à l'échelle pour des tâches à long horizon en divisant récursivement les trajectoires, obtenant des résultats de pointe sur des benchmarks difficiles sans avoir besoin de régler le paramètre de pas n.
Un nouvel algorithme d'apprentissage par renforcement appelé apprentissage par renforcement transitif (TRL) a été introduit, basé sur un paradigme diviser pour régner au lieu de l'apprentissage par différence temporelle (TD) traditionnel. L'apprentissage TD souffre d'une accumulation d'erreurs sur de longs horizons, et bien que le TD à n pas réduise cela linéairement, il nécessite un réglage minutieux de n. Le TRL réduit le nombre de récursions de Bellman de manière logarithmique en divisant récursivement les trajectoires en segments de longueur égale et en combinant leurs valeurs. En pratique, le TRL limite la recherche de sous-objectifs aux états de l'ensemble de données et utilise la régression des expectiles pour éviter la surestimation. Évalué sur les tâches les plus difficiles de OGBench, humanoidmaze et puzzle (jusqu'à 3000 pas), le TRL a obtenu les meilleures performances parmi les bases de référence solides et a égalé le meilleur TD à n pas réglé individuellement sans nécessiter de réglage de n. La méthode suppose actuellement une dynamique déterministe et se limite à l'apprentissage par renforcement conditionné par un objectif, mais des travaux futurs pourraient l'étendre à des tâches basées sur des récompenses et à des environnements stochastiques.
Source: BAIR (Berkeley AI) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches