Học Tăng Cường cho Hệ Thống Gợi Ý: Tối Ưu Hóa Sự Hài Lòng của Người Dùng trong Một Phiên
VK
Các nhà nghiên cứu từ VK Research trình bày một bài báo được chấp nhận tại hội thảo KDD 2026. Họ sử dụng học tăng cường để tối ưu hóa sự hài lòng lâu dài của người dùng trong các hệ thống gợi ý, giải quyết sự không khớp giữa mức độ tương tác ngay lập tức và các chỉ số sản phẩm dài hạn. Mô hình, được huấn luyện với REINFORCE và hiệu chỉnh off-policy nhiều bước, nhằm cải thiện tối ưu hóa ở mức độ phiên.
Artem Matveev từ VK Research thảo luận về công trình nghiên cứu của họ được chấp nhận tại hội thảo Tối ưu hóa Hành trình Khách hàng Từ đầu đến cuối (End-to-End Customer Journey Optimization) của KDD 2026. Bài báo có tựa đề 'Tối ưu hóa ở mức phiên cho truy vấn quy mô lớn sử dụng REINFORCE với hiệu chỉnh ngoài chính sách đa bước' (Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction), giải quyết vấn đề rằng các hệ thống gợi ý thường tối ưu hóa cho tương tác ngay lập tức của người dùng (ví dụ: số lần nhấp chuột hoặc lượt thích) nhưng các chỉ số sản phẩm lại mang tính dài hạn (ví dụ: tỷ lệ giữ chân hoặc tổng thời gian sử dụng). Họ mô hình hóa bài toán gợi ý như một quá trình quyết định Markov (MDP), trong đó tác tử là hệ thống gợi ý, môi trường là người dùng, trạng thái là lịch sử người dùng, hành động là các mục được gợi ý, và phần thưởng là phản hồi của người dùng. Để học một chính sách tối đa hóa phần thưởng dài hạn, họ sử dụng các phương pháp gradient chính sách, cụ thể là REINFORCE. Vì việc học trên chính sách là không khả thi, họ áp dụng học ngoài chính sách với lấy mẫu quan trọng để hiệu chỉnh sự khác biệt giữa chính sách hành vi (tạo ra các bản ghi) và chính sách mục tiêu. Họ cũng thảo luận về các phương pháp đánh giá ngoài chính sách: Phương pháp trực tiếp (DM), Điểm số xu hướng nghịch đảo (IPS), và Phương pháp bền vững kép (DR), đồng thời đề cập đến thách thức về phương sai cao trong các trọng số quan trọng.
Nguồn: Habr — хаб ИИ —
bản gốc
