بطولة نماذج الرفع: اختبار S-learner وT-learner وX-learner وCausal Forest على بيانات اصطناعية وشبه اصطناعية باستخدام مقياس PEHE
أجرى المحلل في Avito، Grisha Kryukov، مقارنة بين أربعة نماذج رفع شائعة: S-learner وT-learner وX-learner وCausal Forest. استخدمت البطولة بيانات اصطناعية وشبه اصطناعية، مع تقييم الجودة بواسطة مقياس PEHE. تم تحليل بنى النماذج ونتائج مرحلة المجموعات بالتفصيل.
Аналитик Avito Гриша Крюков организовал чемпионат среди четырёх uplift-моделей — S-learner, T-learner, X-learner и Causal Forest — для оценки индивидуальных эффектов (uplift). Все модели использовали градиентный бустинг с дефолтными настройками. Турнир включал групповой этап на синтетических данных, где истинный эффект известен по построению, и полусинтетические данные для приближения к реальным задачам. Качество измерялось метрикой PEHE (Precision in Estimation of Heterogeneous Effect), которая позволяет честно вычислить ошибку предсказания индивидуального каузального эффекта. S-learner обучает одну модель на всех данных с флагом воздействия как признаком. T-learner строит две отдельные модели для групп с воздействием и без. X-learner дополнительно использует псевдоэффекты и модель склонности (propensity model) для взвешивания. Causal Forest — ансамбль деревьев, которые оптимизируют разбиения для максимизации различий в эффекте воздействия. В статье также обсуждаются сильные и слабые стороны каждой архитектуры, включая чувствительность к дисбалансу и вычислительную сложность.
المصدر: Habr — хаб ML —
الأصلي
