추천을 위한 강화학습: 세션 전반에 걸친 사용자 만족도 최적화
VK
VK Research의 연구진이 KDD 2026 워크숍에서 채택된 논문을 발표했습니다. 그들은 추천 시스템에서 장기적인 사용자 만족도를 최적화하기 위해 강화학습을 사용하며, 즉각적인 참여와 장기적인 제품 지표 간의 불일치를 해결하고자 합니다. REINFORCE와 다단계 오프-폴리시 보정으로 훈련된 이 모델은 세션 수준 최적화를 개선하는 것을 목표로 합니다.
VK Research의 Artem Matveev가 KDD 2026의 End-to-End Customer Journey Optimization 워크숍에서 채택된 그들의 논문에 대해 논의합니다. 논문 '세션 수준 최적화를 위한 대규모 검색의 REINFORCE 및 다단계 오프-폴리시 보정(Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction)'은 추천 시스템이 일반적으로 즉각적인 사용자 참여(예: 클릭이나 좋아요)를 최적화하지만, 제품 지표는 장기적(예: 유지율이나 총 체류 시간)이라는 문제를 다룹니다. 그들은 추천 문제를 마르코프 결정 과정(MDP)으로 정의합니다. 여기서 에이전트는 추천자, 환경은 사용자, 상태는 사용자 기록, 행동은 추천 항목, 보상은 사용자 피드백입니다. 장기 보상을 최대화하는 정책을 학습하기 위해 정책 그래디언트 방법, 특히 REINFORCE를 사용합니다. 온-폴리시 학습이 비현실적이므로, 그들은 중요도 샘플링을 사용한 오프-폴리시 학습을 통해 행동 정책(로그를 생성한 정책)과 목표 정책 간의 차이를 보정합니다. 또한 오프-폴리시 평가 방법인 직접 방법(DM), 역경향 점수(IPS), 이중 강건(DR)에 대해 논의하고, 중요도 가중치의 높은 분산 문제를 언급합니다.
출처: Habr — хаб ИИ —
원문
