无需时序差分学习的强化学习:新的分治算法
Berkeley Artificial Intelligence Research (BAIR)
研究人员提出了传递强化学习(TRL),一种新的分治强化学习算法,避免了时序差分学习。TRL通过递归分割轨迹,扩展到长时域任务,在无需调整步数参数n的情况下,在具有挑战性的基准测试中取得了最先进的结果。
一种名为传递强化学习(Transitive RL, TRL)的新型强化学习算法被提出,该算法基于分治范式,而非传统的时间差分(temporal difference, TD)学习。TD学习在长时域步数上存在误差累积问题,而n步TD虽能线性减少此问题,但需要仔细调整n值。TRL通过将轨迹递归分割为等长片段并组合其值,将贝尔曼递归次数对数级减少。实际应用中,TRL将子目标搜索限制在数据集状态内,并采用分位数回归以避免过高估计。在OGBench最困难的类人迷宫和拼图任务(最多3000步)中,TRL在强基线中取得了最佳性能,并与最优化的单独调参n步TD相当,且无需调参n。该方法目前假设确定性动力学,并限于目标条件强化学习,但未来工作可能扩展至基于奖励的任务和随机环境。
来源: BAIR (Berkeley AI) —
原文
