Tournoi des modèles d'uplift : test de S-learner, T-learner, X-learner et Causal Forest sur données synthétiques et semi-synthétiques avec la métrique PEHE
Un analyste d'Avito a organisé un tournoi comparant quatre modèles d'uplift populaires (S-learner, T-learner, X-learner, Causal Forest) sur des données synthétiques et semi-synthétiques à l'aide de la métrique PEHE. L'article explique les architectures, forces et faiblesses des modèles à travers une analogie footballistique, aboutissant à une phase de groupes et à un arbre à élimination directe. Le code est disponible sur GitHub pour reproduction.
L'article, rédigé par Grigory Kryukov, analyste au sein de l'équipe de confiance et sécurité d'Avito, présente un championnat entre quatre modèles d'uplift : le S-learner, le T-learner, le X-learner et la Causal Forest. En utilisant une analogie avec la Coupe du monde de football, l'auteur décrit l'architecture de chaque modèle : le S-learner entraîne un modèle unique avec le traitement comme caractéristique ; le T-learner entraîne des modèles séparés pour les groupes de traitement et de contrôle ; le X-learner ajoute une deuxième étape d'effets pseudo-individuels et un modèle de propension ; la Causal Forest adapte la forêt aléatoire pour optimiser directement les effets de traitement hétérogènes. Le tournoi utilise des données synthétiques (où les véritables effets de traitement individuels sont connus) et des données semi-synthétiques pour mesurer la qualité des modèles via la métrique PEHE. La phase de groupes oppose les modèles entre eux sur des données synthétiques, suivie d'une phase à élimination directe. L'article conclut avec les résultats : la Causal Forest remporte le championnat, étant la plus robuste dans tous les scénarios, tandis que le X-learner se montre performant sur des tâches non linéaires mais reste complexe. Le code complet est fourni sur GitHub.
Source: Habr — хаб ML —
original
