InvestigaciónNegocios y Mercado 🇷🇺 13.08.2026 01:03

Aprendizaje por Refuerzo para Recomendaciones: Optimizando la Satisfacción del Usuario a lo Largo de una Sesión

VKVK
Investigadores de VK Research presentan un artículo aceptado en el taller de KDD 2026. Utilizan aprendizaje por refuerzo para optimizar la satisfacción del usuario a largo plazo en sistemas de recomendación, abordando el desajuste entre la participación inmediata y las métricas de producto a largo plazo. El modelo, entrenado con REINFORCE y corrección multi-paso fuera de la política, tiene como objetivo mejorar la optimización a nivel de sesión.
Artem Matveev, de VK Research, habla sobre su trabajo aceptado en el taller de Optimización del Recorrido del Cliente de Extremo a Extremo de KDD 2026. El artículo, 'Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction', aborda el problema de que los sistemas de recomendación suelen optimizar para la interacción inmediata del usuario (por ejemplo, clics o me gusta), pero las métricas de producto son a largo plazo (por ejemplo, retención o tiempo total). Enmarcan el problema de recomendación como un Proceso de Decisión de Markov (MDP, por sus siglas en inglés) donde el agente es el recomendador, el entorno es el usuario, los estados son el historial del usuario, las acciones son los elementos recomendados y las recompensas son los comentarios del usuario. Para aprender una política que maximice la recompensa a largo plazo, utilizan métodos de gradiente de política, específicamente REINFORCE. Dado que el aprendizaje on-policy no es práctico, emplean aprendizaje off-policy con muestreo por importancia para corregir la diferencia entre la política de comportamiento (que generó los registros) y la política objetivo. También discuten métodos de evaluación off-policy: el Método Directo (DM, por sus siglas en inglés), la Puntuación de Propensión Inversa (IPS, por sus siglas en inglés) y el Doblemente Robusto (DR, por sus siglas en inglés), y mencionan el desafío de la alta varianza en los pesos de importancia.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas