RL ilman TD-oppimista: Uusi 'jako ja hallitse' -algoritmi
Berkeley AI Researchin (BAIR) tutkijat ovat esitelleet Transitive RL (TRL) -algoritmin, joka perustuu 'jako ja hallitse' -paradigmaan off-policy-vahvistusoppimisessa (RL). TRL vähentää Bellman-rekursioiden määrää logaritmisesti, välttäen TD-oppimiselle tyypilliset virheiden kertymisongelmat. Algoritmi osoitti ylivoimaisia tuloksia monimutkaisissa pitkäntähtäimen tehtävissä ilman, että hyperparametria n tarvitsi säätää, kuten n-askeleisessa TD-oppimisessa.
Berkeley Artificial Intelligence Research (BAIR)
