अनुशंसाओं के लिए सुदृढीकरण लर्निंग: सत्र में उपयोगकर्ता संतुष्टि को अनुकूलित करना
VK
वीके रिसर्च के शोधकर्ताओं ने KDD 2026 कार्यशाला में स्वीकृत एक पेपर प्रस्तुत किया है। वे अनुशंसा प्रणालियों में दीर्घकालिक उपयोगकर्ता संतुष्टि को अनुकूलित करने के लिए सुदृढीकरण लर्निंग का उपयोग करते हैं, जो तत्काल सहभागिता और दीर्घकालिक उत्पाद मेट्रिक्स के बीच विसंगति को संबोधित करता है। यह मॉडल, जिसे REINFORCE और मल्टी-स्टेप ऑफ-पॉलिसी सुधार के साथ प्रशिक्षित किया गया है, का उद्देश्य सत्र-स्तरीय अनुकूलन में सुधार करना है।
वीके रिसर्च के आर्टेम मतवेव ने अपने उस शोध पेपर पर चर्चा की, जिसे केडीडी 2026 की एंड-टू-एंड कस्टमर जर्नी ऑप्टिमाइज़ेशन कार्यशाला में स्वीकार किया गया है। पेपर, 'सेशन-लेवल ऑप्टिमाइज़ेशन फॉर लार्ज-स्केल रिट्रीवल यूज़िंग रिइन्फोर्स विद मल्टी-स्टेप ऑफ-पॉलिसी करेक्शन', उस समस्या को संबोधित करता है कि रिकमेंडेशन सिस्टम आमतौर पर तत्काल उपयोगकर्ता जुड़ाव (जैसे क्लिक या लाइक) के लिए अनुकूलित होते हैं, लेकिन उत्पाद मेट्रिक्स दीर्घकालिक होते हैं (जैसे प्रतिधारण या कुल समय)। वे रिकमेंडेशन समस्या को मार्कोव डिसीज़न प्रोसेस (एमडीपी) के रूप में तैयार करते हैं, जहाँ एजेंट रिकमेंडर है, पर्यावरण उपयोगकर्ता है, राज्य उपयोगकर्ता इतिहास हैं, क्रियाएँ अनुशंसित आइटम हैं, और पुरस्कार उपयोगकर्ता प्रतिक्रिया हैं। दीर्घकालिक पुरस्कार को अधिकतम करने वाली नीति सीखने के लिए, वे पॉलिसी ग्रेडिएंट विधियों का उपयोग करते हैं, विशेष रूप से रिइन्फोर्स का। चूंकि ऑन-पॉलिसी लर्निंग अव्यावहारिक है, वे महत्व नमूनाकरण के साथ ऑफ-पॉलिसी लर्निंग का उपयोग करते हैं ताकि व्यवहार नीति (जिसने लॉग उत्पन्न किए) और लक्ष्य नीति के बीच अंतर को ठीक किया जा सके। वे ऑफ-पॉलिसी मूल्यांकन विधियों पर भी चर्चा करते हैं: डायरेक्ट मेथड (डीएम), इनवर्स प्रोपेन्सिटी स्कोरिंग (आईपीएस), और डबली रोबस्ट (डीआर), और महत्व भार में उच्च विचरण की चुनौती का उल्लेख करते हैं।
स्रोत: Habr — хаб ИИ —
मूल
