RisetBisnis & Pasar 🇷🇺 13.08.2026 01:03

Pembelajaran Penguatan untuk Rekomendasi: Mengoptimalkan Kepuasan Pengguna Sepanjang Sesi

VKVK
Para peneliti dari VK Research mempresentasikan makalah yang diterima di lokakarya KDD 2026. Mereka menggunakan pembelajaran penguatan untuk mengoptimalkan kepuasan pengguna jangka panjang dalam sistem rekomendasi, mengatasi ketidaksesuaian antara keterlibatan langsung dan metrik produk jangka panjang. Model, yang dilatih dengan REINFORCE dan koreksi off-policy multi-langkah, bertujuan untuk meningkatkan optimasi tingkat sesi.
Artem Matveev dari VK Research membahas karya mereka yang diterima di lokakarya End-to-End Customer Journey Optimization pada KDD 2026. Makalah berjudul 'Session-Level Optimization for Large-Scale Retrieval menggunakan REINFORCE dengan Multi-Step Off-Policy Correction' ini membahas masalah bahwa sistem rekomendasi biasanya dioptimalkan untuk keterlibatan pengguna jangka pendek (misalnya, klik atau suka), tetapi metrik produk bersifat jangka panjang (misalnya, retensi atau total waktu). Mereka merumuskan masalah rekomendasi sebagai Proses Keputusan Markov (MDP) di mana agen adalah pemberi rekomendasi, lingkungan adalah pengguna, keadaan adalah riwayat pengguna, tindakan adalah item yang direkomendasikan, dan imbalan adalah umpan balik pengguna. Untuk mempelajari kebijakan yang memaksimalkan imbalan jangka panjang, mereka menggunakan metode gradien kebijakan, khususnya REINFORCE. Karena pembelajaran on-policy tidak praktis, mereka menggunakan pembelajaran off-policy dengan importance sampling untuk mengoreksi perbedaan antara kebijakan perilaku (yang menghasilkan log) dan kebijakan target. Mereka juga membahas metode evaluasi off-policy: Metode Langsung (DM), Inverse Propensity Scoring (IPS), dan Doubly Robust (DR), serta menyebutkan tantangan varians tinggi dalam bobot importance.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru