Pekiştirmeli Öğrenme ile Öneriler: Oturum Boyunca Kullanıcı Memnuniyetini Optimize Etme
VK
VK Research araştırmacıları, KDD 2026 çalıştayında kabul edilen bir makale sunuyor. Öneri sistemlerinde uzun vadeli kullanıcı memnuniyetini optimize etmek için pekiştirmeli öğrenme kullanıyor ve anlık katılım ile uzun vadeli ürün metrikleri arasındaki uyumsuzluğu ele alıyorlar. REINFORCE ve çok adımlı politika dışı düzeltme ile eğitilen model, oturum düzeyinde optimizasyonu iyileştirmeyi hedefliyor.
Artem Matveev, VK Research'ten, KDD 2026 Uçtan Uca Müşteri Yolculuğu Optimizasyonu çalıştayında kabul edilen çalışmalarını tartışıyor. 'Çok Adımlı Politika Dışı Düzeltme ile REINFORCE Kullanarak Büyük Ölçekli Bilgi Erişimi için Oturum Düzeyinde Optimizasyon' başlıklı makale, öneri sistemlerinin genellikle anlık kullanıcı etkileşimini (örneğin tıklamalar veya beğeniler) optimize ettiğini ancak ürün metriklerinin uzun vadeli olduğunu (örneğin kullanıcıyı elde tutma veya toplam süre) ele almaktadır. Öneri problemini bir Markov Karar Süreci (MDP) olarak çerçevelerler; burada ajan önerici, ortam kullanıcı, durumlar kullanıcı geçmişi, eylemler önerilen öğeler ve ödüller kullanıcı geri bildirimidir. Uzun vadeli ödülü en üst düzeye çıkaran bir politika öğrenmek için politika gradyan yöntemlerini, özellikle REINFORCE'u kullanırlar. Politika üzerinde öğrenme pratik olmadığından, davranış politikası (günlükleri üreten) ile hedef politika arasındaki farkı düzeltmek için önem örneklemesi ile politika dışı öğrenmeyi kullanırlar. Ayrıca politika dışı değerlendirme yöntemlerini tartışırlar: Doğrudan Yöntem (DM), Ters Eğilim Puanlaması (IPS) ve Çift Sağlam (DR) ve önem ağırlıklarındaki yüksek varyans zorluğundan bahsederler.
Kaynak: Habr — хаб ИИ —
orijinal
