Verstärkungslernen für Empfehlungen: Optimierung der Nutzerzufriedenheit über eine Sitzung hinweg
VK
Forscher von VK Research stellen ein Paper vor, das auf dem KDD-2026-Workshop angenommen wurde. Sie nutzen Verstärkungslernen, um die langfristige Nutzerzufriedenheit in Empfehlungssystemen zu optimieren und adressieren die Diskrepanz zwischen sofortigem Engagement und langfristigen Produktmetriken. Das mit REINFORCE und Multi-Step-Off-Policy-Korrektur trainierte Modell zielt darauf ab, die Optimierung auf Sitzungsebene zu verbessern.
Artem Matveev von VK Research spricht über ihre Arbeit, die auf dem Workshop zur Optimierung der End-to-End-Kundenreise der KDD 2026 angenommen wurde. Das Papier mit dem Titel 'Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction' behandelt das Problem, dass Empfehlungssysteme typischerweise auf unmittelbares Nutzerengagement (z. B. Klicks oder Likes) optimiert werden, während Produktmetriken langfristig sind (z. B. Bindung oder Gesamtzeit). Sie formulieren das Empfehlungsproblem als Markov-Entscheidungsprozess (MDP), bei dem der Agent der Empfehlungsalgorithmus ist, die Umgebung der Nutzer, Zustände die Nutzerhistorie, Aktionen empfohlene Elemente und Belohnungen das Nutzerfeedback sind. Um eine Richtlinie zu lernen, die die langfristige Belohnung maximiert, verwenden sie Policy-Gradient-Methoden, insbesondere REINFORCE. Da On-Policy-Lernen unpraktisch ist, setzen sie Off-Policy-Lernen mit Importance Sampling ein, um die Diskrepanz zwischen der Verhaltensrichtlinie (die die Logs erzeugt hat) und der Zielrichtlinie zu korrigieren. Sie diskutieren auch Off-Policy-Evaluationsmethoden: die direkte Methode (DM), Inverse Propensity Scoring (IPS) und Doubly Robust (DR), und erwähnen die Herausforderung hoher Varianz bei Importance-Gewichten.
Quelle: Habr — хаб ИИ —
Original
