强化学习在推荐系统中的应用:跨会话优化用户满意度
VK
来自VK Research的研究人员提交了一篇被KDD 2026研讨会接收的论文。他们利用强化学习来优化推荐系统中的长期用户满意度,解决了即时参与度与长期产品指标之间的不匹配问题。该模型采用REINFORCE算法和多步离策略校正进行训练,旨在提升会话级别的优化效果。
Artem Matveev来自VK Research,讨论了他们在KDD 2026的端到端客户旅程优化研讨会上被接收的工作。论文《使用多步离策略校正的REINFORCE进行大规模检索的会话级优化》解决了推荐系统通常优化即时用户参与度(例如点击或点赞)但产品指标是长期性的(例如留存或总时长)这一问题。他们将推荐问题建模为马尔可夫决策过程(Markov Decision Process,MDP),其中智能体是推荐器,环境是用户,状态是用户历史,动作是推荐的项目,奖励是用户反馈。为了学习最大化长期奖励的策略,他们使用了策略梯度方法,特别是REINFORCE算法。由于在策略学习不可行,他们采用离策略学习,通过重要性采样来校正行为策略(生成日志的策略)与目标策略之间的差异。他们还讨论了离策略评估方法:直接法(Direct Method,DM)、逆倾向得分(Inverse Propensity Scoring,IPS)和双重稳健(Doubly Robust,DR),并提到了重要性权重高方差这一挑战。
来源: Habr — хаб ИИ —
原文
