Torneo entre modelos de uplift: probando S-learner, T-learner, X-learner y Causal Forest con datos sintéticos y semisintéticos usando la métrica PEHE
Un analista de Avito realizó un torneo comparando cuatro modelos populares de uplift (S-learner, T-learner, X-learner y Causal Forest) con datos sintéticos y semisintéticos utilizando la métrica PEHE. El artículo explica las arquitecturas, fortalezas y debilidades de los modelos mediante una analogía futbolística, culminando en una fase de grupos y una eliminatoria. El código está disponible en GitHub para su reproducción.
El artículo, escrito por Grigory Kryukov, analista del equipo de confianza y seguridad de Avito, presenta un campeonato entre cuatro modelos de incremento (uplift): S-learner, T-learner, X-learner y Causal Forest. Utilizando una analogía de la Copa Mundial de fútbol, el autor describe la arquitectura de cada modelo: S-learner entrena un único modelo con el tratamiento como característica; T-learner entrena modelos separados para los grupos de tratamiento y control; X-learner añade una segunda etapa de pseudoefectos y un modelo de propensión; y Causal Forest adapta el random forest para optimizar directamente los efectos heterogéneos del tratamiento. El torneo utiliza datos sintéticos (donde se conocen los verdaderos efectos individuales del tratamiento) y datos semisintéticos para medir la calidad del modelo mediante la métrica PEHE (Error Cuadrático Medio de los Efectos del Tratamiento Individual Pronosticados). La fase de grupos enfrenta a los modelos entre sí con datos sintéticos, seguida de una fase eliminatoria. El artículo concluye con los resultados: Causal Forest gana el campeonato, siendo el más robusto en todos los escenarios, mientras que X-learner muestra fortaleza en tareas no lineales, aunque es complejo. El código completo se proporciona en GitHub.
Fuente: Habr — хаб ML —
original
