PesquisaNegócios e Mercado 🇷🇺 13.08.2026 01:03

Aprendizado por Reforço para Recomendações: Otimizando a Satisfação do Usuário ao Longo de uma Sessão

VKVK
Pesquisadores da VK Research apresentam um artigo aceito no workshop do KDD 2026. Eles usam aprendizado por reforço para otimizar a satisfação do usuário em sistemas de recomendação, abordando a incompatibilidade entre o engajamento imediato e as métricas de longo prazo do produto. O modelo, treinado com REINFORCE e correção fora da política em múltiplos passos, visa melhorar a otimização em nível de sessão.
Artem Matveev, da VK Research, discute o trabalho aceito no workshop de Otimização da Jornada do Cliente de Ponta a Ponta do KDD 2026. O artigo, 'Otimização em Nível de Sessão para Recuperação em Grande Escala usando REINFORCE com Correção Off-Policy Multi-Passo', aborda o problema de que os sistemas de recomendação normalmente otimizam o engajamento imediato do usuário (por exemplo, cliques ou curtidas), mas as métricas de produto são de longo prazo (por exemplo, retenção ou tempo total). Eles formulam o problema de recomendação como um Processo de Decisão de Markov (MDP), onde o agente é o recomendador, o ambiente é o usuário, os estados são o histórico do usuário, as ações são os itens recomendados e as recompensas são o feedback do usuário. Para aprender uma política que maximize a recompensa de longo prazo, eles usam métodos de gradiente de política, especificamente o REINFORCE. Como o aprendizado on-policy é impraticável, eles empregam aprendizado off-policy com amostragem por importância para corrigir a diferença entre a política de comportamento (que gerou os logs) e a política alvo. Eles também discutem métodos de avaliação off-policy: Método Direto (DM), Pontuação de Propensão Inversa (IPS) e o método Doubly Robust (DR), e mencionam o desafio da alta variância nos pesos de importância.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas