研究 🇺🇸 27.07.2026 17:04

TD学習不要の強化学習:新しい分割統治アルゴリズム

Berkeley Artificial Intelligence Research (BAIR)Berkeley Artificial Intelligence Research (BAIR)
研究者らは、時間差学習を回避する新たな分割統治型強化学習アルゴリズムであるTransitive RL(TRL)を提案する。TRLは軌跡を再帰的に分割することで長期的なタスクに対応し、ステップパラメータnの調整を必要とせずに、困難なベンチマークで最先端の結果を達成する。
新しい強化学習アルゴリズムであるTransitive RL(TRL)が導入された。これは、従来の時間差学習(TD学習)ではなく、分割統治パラダイムに基づいている。TD学習は長いホライゾンにおいて誤差が蓄積される問題があり、nステップTDはこれを線形に軽減するものの、nの注意深い調整が必要である。TRLは、軌跡を等しい長さのセグメントに再帰的に分割し、その値を結合することで、ベルマン再帰の回数を対数的に削減する。実用的には、TRLはサブゴール探索をデータセット状態に制限し、過大評価を避けるために期待値回帰(expectile regression)を使用する。OGBenchの最も難しいhumanoidmazeおよびパズルタスク(最大3000ステップ)で評価したところ、TRLは強力なベースラインの中で最良の性能を達成し、個別に調整された最良のnステップTDに匹敵し、nの調整を必要としなかった。この手法は現時点では決定論的ダイナミクスを仮定し、目標条件付き強化学習に限定されているが、将来の研究では報酬ベースのタスクや確率的環境に拡張される可能性がある。
出典: BAIR (Berkeley AI) — 原文
関連記事 ↓
新着ニュース