OnderzoekBedrijf & Markt 🇷🇺 13.08.2026 01:03

Reinforcement Learning voor Aanbevelingen: Optimaliseren van Gebruikerstevredenheid over een Sessie

VKVK
Onderzoekers van VK Research presenteren een paper die is geaccepteerd voor de KDD 2026-workshop. Ze gebruiken reinforcement learning om de langetermijngebruikerstevredenheid in aanbevelingssystemen te optimaliseren, waarbij ze inspelen op de mismatch tussen directe betrokkenheid en langetermijnproductmetrieken. Het model, getraind met REINFORCE en multi-step off-policy correctie, is gericht op het verbeteren van de optimalisatie op sessieniveau.
Artem Matveev van VK Research bespreekt hun werk dat is geaccepteerd voor de workshop 'End-to-End Customer Journey Optimization' van KDD 2026. Het paper, 'Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction', behandelt het probleem dat aanbevelingssystemen doorgaans optimaliseren voor onmiddellijke gebruikersbetrokkenheid (bijvoorbeeld klikken of likes), terwijl productmetriek juist langetermijnresultaten zijn (zoals retentie of totale tijd). Ze framen het aanbevelingsprobleem als een Markov Decision Process (MDP) waarin de agent de recommender is, de omgeving de gebruiker, toestanden de gebruikersgeschiedenis, acties de aanbevolen items en beloningen de gebruikersfeedback. Om een beleid te leren dat de langetermijnbeloning maximaliseert, gebruiken ze policy gradient-methoden, specifiek REINFORCE. Omdat on-policy leren onpraktisch is, passen ze off-policy leren toe met importance sampling om te corrigeren voor het verschil tussen het gedragsbeleid (dat de logs genereerde) en het doelbeleid. Ze bespreken ook off-policy evaluatiemethoden: Direct Method (DM), Inverse Propensity Scoring (IPS) en Doubly Robust (DR), en noemen de uitdaging van hoge variantie in importance weights.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws