Обучение с подкреплением для рекомендаций: оптимизация удовлетворенности пользователя в рамках сессии

VK
Исследователи из VK Research представили статью, принятую на воркшопе конференции KDD 2026. Они используют обучение с подкреплением для оптимизации долгосрочной удовлетворенности пользователей в рекомендательных системах, устраняя несоответствие между немедленным вовлечением и долгосрочными продуктовыми метриками. Модель, обученная с помощью алгоритма REINFORCE и многократной коррекции вне политики, направлена на улучшение оптимизации на уровне сессии.
Артём Матвеев из VK Research рассказывает о своей работе, принятой на семинар по оптимизации пути клиента от начала до конца (End-to-End Customer Journey Optimization) конференции KDD 2026. Статья под названием «Оптимизация на уровне сессий для крупномасштабного поиска с использованием REINFORCE с многошаговой офлайн-коррекцией» (Session-Level Optimization for Large-Scale Retrieval using
Показать ещё ↓
Источник: Habr — хаб ИИ — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости