Uplift-mallien mestaruus: S-learnerin, T-learnerin, X-learnerin ja Causal Forestin testaus synteettisellä ja semi-synteettisellä datalla PEHE-mittarin avulla
Avito-analytiikko Grisha Kryukov suoritti vertailun neljästä suositusta uplift-mallista: S-learner, T-learner, X-learner ja Causal Forest. Turnauksessa käytettiin synteettistä ja semi-synteettistä dataa, ja laatua arvioitiin PEHE-mittarilla. Mallien arkkitehtuurit ja lohkovaiheen tulokset analysoidaan yksityiskohtaisesti.
Аналитик Avito Гриша Крюков организовал чемпионат среди четырёх uplift-моделей — S-learner, T-learner, X-learner и Causal Forest — для оценки индивидуальных эффектов (uplift). Все модели использовали градиентный бустинг с дефолтными настройками. Турнир включал групповой этап на синтетических данных, где истинный эффект известен по построению, и полусинтетические данные для приближения к реальным задачам. Качество измерялось метрикой PEHE (Precision in Estimation of Heterogeneous Effect), которая позволяет честно вычислить ошибку предсказания индивидуального каузального эффекта. S-learner обучает одну модель на всех данных с флагом воздействия как признаком. T-learner строит две отдельные модели для групп с воздействием и без. X-learner дополнительно использует псевдоэффекты и propensity-модель для взвешивания. Causal Forest — ансамбль деревьев, которые оптимизируют сплиты для максимизации различий в эффекте воздействия. В статье также обсуждаются сильные и слабые стороны каждой архитектуры, включая чувствительность к дисбалансу и вычислительную сложность.
Lähde: Habr — хаб ML —
Alkuperäinen
