Apprentissage par renforcement pour les recommandations : optimiser la satisfaction des utilisateurs sur une session
VK
Des chercheurs de VK Research présentent un article accepté à l'atelier KDD 2026. Ils utilisent l'apprentissage par renforcement pour optimiser la satisfaction à long terme des utilisateurs dans les systèmes de recommandation, en remédiant à l'inadéquation entre l'engagement immédiat et les indicateurs de produit à long terme. Le modèle, entraîné avec REINFORCE et une correction hors politique sur plusieurs étapes, vise à améliorer l'optimisation au niveau de la session.
Artem Matveev de VK Research évoque leurs travaux acceptés à l'atelier sur l'optimisation du parcours client de bout en bout du KDD 2026. L'article, intitulé « Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction », aborde le problème selon lequel les systèmes de recommandation optimisent généralement l'engagement immédiat de l'utilisateur (par exemple, les clics ou les mentions « j'aime »), alors que les métriques produit sont à long terme (par exemple, la rétention ou le temps total passé). Ils formulent le problème de recommandation comme un processus de décision markovien (MDP) dans lequel l'agent est le système de recommandation, l'environnement est l'utilisateur, les états sont l'historique de l'utilisateur, les actions sont les éléments recommandés et les récompenses sont les retours des utilisateurs. Pour apprendre une politique qui maximise la récompense à long terme, ils utilisent des méthodes de gradient de politique, en particulier REINFORCE. Comme l'apprentissage sur-politique n'est pas pratique, ils recourent à l'apprentissage hors-politique avec échantillonnage d'importance pour corriger la différence entre la politique de comportement (qui a généré les journaux) et la politique cible. Ils discutent également des méthodes d'évaluation hors-politique : la méthode directe (DM), le score de propension inverse (IPS) et la méthode doublement robuste (DR), et mentionnent le défi de la variance élevée des poids d'importance.
Source: Habr — хаб ИИ —
original
