REINFORCE with Multi-Step Off-Policy Correction) решает проблему того, что рекомендательные системы обычно оптимизируются под немедленное вовлечение пользователя (например, клики или лайки), тогда как продуктовые метрики являются долгосрочными (например, удержание или общее время). Авторы формулируют задачу рекомендаций как марковский процесс принятия решений (МППР), где агентом выступает рекомендательная система, средой — пользователь, состояниями — история пользователя, действиями — рекомендуемые элементы, а вознаграждением — реакция пользователя. Чтобы обучить политику, максимизирующую долгосрочное вознаграждение, они используют методы градиента политики, в частности REINFORCE. Поскольку обучение в соответствии с текущей политикой (on-policy) непрактично, они применяют обучение вне политики (off-policy) с использованием выборки по важности для коррекции различий между поведенческой политикой (которая генерировала журналы) и целевой политикой. Они также обсуждают методы оценки вне политики: прямой метод (Direct Method, DM), оценку по обратной склонности (Inverse Propensity Scoring, IPS) и двойственно устойчивую оценку (Doubly Robust, DR), а также упоминают проблему высокой дисперсии весов важности.