RL без TD-обучения: новый алгоритм «разделяй и властвуй»
Berkeley Artificial Intelligence Research (BAIR)
Исследователи предложили Transitive RL (TRL) — новый алгоритм обучения с подкреплением на основе принципа «разделяй и властвуй», который не использует метод разности во времени (temporal difference learning). TRL масштабируется на задачи с длинным горизонтом, рекурсивно разбивая траектории, и достигает самых современных результатов на сложных бенчмарках без необходимости настройки параметра шага n.
Представлен новый алгоритм обучения с подкреплением под названием Транзитивное RL (TRL), основанный на парадигме «разделяй и властвуй» вместо традиционного обучения по временным разностям (temporal difference, TD). Обучение TD страдает от накопления ошибок на длинных горизонтах, и хотя n-шаговое TD уменьшает это линейно, оно требует тщательной настройки n. TRL логарифмически сокращает количество
Показать ещё ↓
Источник: BAIR (Berkeley AI) —
оригинал
