Nghiên cứu 🇷🇺 24.07.2026 03:04

Giải vô địch giữa các mô hình Uplift: Kiểm tra S-learner, T-learner, X-learner và Causal Forest trên dữ liệu tổng hợp và bán tổng hợp với chỉ số PEHE

Một nhà phân tích từ Avito đã tổ chức một giải đấu so sánh bốn mô hình uplift phổ biến (S-learner, T-learner, X-learner, Causal Forest) trên dữ liệu tổng hợp và bán tổng hợp sử dụng chỉ số PEHE. Bài viết giải thích kiến trúc, điểm mạnh và điểm yếu của các mô hình thông qua phép loại suy chủ đề bóng đá, đỉnh cao là vòng bảng và vòng đấu loại trực tiếp. Mã nguồn có sẵn trên GitHub để tái tạo kết quả.
Bài viết do Grigory Kryukov, nhà phân tích thuộc nhóm tin cậy và an toàn của Avito, viết ra đã trình bày một giải vô địch giữa bốn mô hình uplift: S-learner, T-learner, X-learner và Causal Forest. Sử dụng phép loại suy với World Cup bóng đá, tác giả mô tả kiến trúc của từng mô hình: S-learner huấn luyện một mô hình duy nhất với biến can thiệp như một đặc trưng; T-learner huấn luyện các mô hình riêng biệt cho nhóm can thiệp và nhóm đối chứng; X-learner bổ sung thêm giai đoạn thứ hai về các hiệu ứng giả và mô hình xu hướng; Causal Forest điều chỉnh rừng ngẫu nhiên để tối ưu trực tiếp cho các hiệu ứng can thiệp không đồng nhất. Giải đấu sử dụng dữ liệu tổng hợp (nơi các hiệu ứng can thiệp thực sự được biết) và dữ liệu bán tổng hợp để đo lường chất lượng mô hình thông qua chỉ số PEHE. Vòng bảng đối đầu các mô hình với nhau trên dữ liệu tổng hợp, tiếp theo là vòng loại trực tiếp. Bài viết kết luận với kết quả: Causal Forest giành chức vô địch, là mô hình mạnh mẽ nhất trong các kịch bản, trong khi X-learner thể hiện sức mạnh trên các nhiệm vụ phi tuyến nhưng phức tạp. Toàn bộ mã nguồn được cung cấp trên GitHub.
Nguồn: Habr — хаб ML — bản gốc
Bài viết liên quan trước đây ↓
Tin mới