рекурсий Беллмана, рекурсивно разбивая траектории на отрезки равной длины и комбинируя их значения. На практике TRL ограничивает поиск подцелей состояниями из набора данных и использует регрессию эксцентилей для избежания переоценки. При оценке на самых сложных задачах OGBench — humanoidmaze и puzzle (до 3000 шагов) — TRL достиг наилучшей производительности среди сильных базовых методов и сравнялся с лучшим отдельно настроенным n-шаговым TD без необходимости настройки n. В настоящее время метод предполагает детерминированную динамику и ограничен обучением с подкреплением, обусловленным целью, но будущие работы могут расширить его на задачи, основанные на вознаграждении, и стохастические среды.