التعلم التعزيزي للتوصيات: تحسين رضا المستخدم عبر الجلسة
VK
يقدم باحثون من VK Research ورقة بحثية تم قبولها في ورشة عمل KDD 2026. يستخدمون التعلم التعزيزي لتحسين رضا المستخدم طويل الأمد في أنظمة التوصية، مما يعالج عدم التوافق بين التفاعل الفوري والمقاييس طويلة الأمد للمنتج. يهدف النموذج، المُدرَّب باستخدام REINFORCE وتصحيح سياسة خارج المسار متعدد الخطوات، إلى تحسين التحسين على مستوى الجلسة.
أرتيم ماتفييف من أبحاث VK يناقش عملهم المقبول في ورشة عمل تحسين رحلة العميل من النهاية إلى النهاية في مؤتمر KDD 2026. الورقة البحثية بعنوان "التحسين على مستوى الجلسة للاسترجاع واسع النطاق باستخدام REINFORCE مع تصحيح خارج السياسة متعدد الخطوات"، تعالج مشكلة أن أنظمة التوصية عادةً ما تُحسَّن للتفاعل الفوري للمستخدم (مثل النقرات أو الإعجابات)، ولكن المقاييس المنتجية طويلة الأجل (مثل الاحتفاظ أو الوقت الإجمالي). يقومون بتأطير مشكلة التوصية كعملية قرار ماركوف (MDP) حيث يكون الوكيل هو المُوصي، والبيئة هي المستخدم، والحالات هي سجل المستخدم، والإجراءات هي العناصر المُوصى بها، والمكافآت هي ملاحظات المستخدم. لتعلم سياسة تزيد من المكافأة طويلة الأجل، يستخدمون طرق تدرج السياسة، وتحديداً REINFORCE. نظراً لأن التعلم داخل السياسة غير عملي، فإنهم يستخدمون التعلم خارج السياسة مع أخذ العينات بالأهمية لتصحيح الفرق بين سياسة السلوك (التي ولّدت السجلات) والسياسة المستهدفة. كما يناقشون طرق التقييم خارج السياسة: الطريقة المباشرة (DM)، وتسجيل النزعة العكسية (IPS)، والقوية المزدوجة (DR)، ويذكرون التحدي المتمثل في التباين العالي لأوزان الأهمية.
المصدر: Habr — хаб ИИ —
الأصلي
