Vahvistusoppiminen suosituksissa: Käyttäjätyytyväisyyden optimointi istunnon aikana
VK
VK Researchin tutkijat esittelevät paperin, joka on hyväksytty KDD 2026 -työpajaan. He käyttävät vahvistusoppimista optimoidakseen pitkän aikavälin käyttäjätyytyväisyyttä suositusjärjestelmissä, vastaten välittömän sitoutumisen ja pitkän aikavälin tuotemittareiden väliseen ristiriitaan. Malli, joka on koulutettu REINFORCE-algoritmilla ja monivaiheisella off-policy-korjauksella, pyrkii parantamaan istuntotason optimointia.
VK Researchin Artem Matveev kertoo heidän työstään, joka hyväksyttiin KDD 2026 -konferenssin End-to-End Customer Journey Optimization -työpajaan. Artikkelissa 'Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction' käsitellään ongelmaa, että suositusjärjestelmät tyypillisesti optimoivat välittömän käyttäjä sitoutumisen (esim. klikkaukset tai tykkäykset) mukaan, mutta tuotemittarit ovat pitkäaikaisia (esim. käyttäjän pysyvyys tai kokonaisaika). He muotoilevat suositusongelman Markovin päätösprosessina (MDP), jossa agentti on suosittelija, ympäristö on käyttäjä, tilat ovat käyttäjän historia, toiminnot ovat suositellut kohteet ja palkkiot ovat käyttäjäpalautetta. Oppiakseen politiikan, joka maksimoi pitkäaikaisen palkkion, he käyttävät politiikkagradienttimenetelmiä, erityisesti REINFORCEa. Koska on-policy-oppiminen on epäkäytännöllistä, he käyttävät off-policy-oppimista tärkeysotannalla korjatakseen eron käyttäytymispolitiikan (joka tuotti lokit) ja kohdepolitiikan välillä. He käsittelevät myös off-policy-arviointimenetelmiä: suora menetelmä (DM), käänteinen taipumuspisteytys (IPS) ja kaksinkertaisesti robusti menetelmä (DR), ja mainitsevat haasteen tärkeyspainojen korkeasta varianssista.
Lähde: Habr — хаб ИИ —
Alkuperäinen
