Campeonato Entre Modelos de Uplift: Testando S-learner, T-learner, X-learner e Causal Forest em Dados Sintéticos e Semissintéticos com a Métrica PEHE
Um analista da Avito realizou um torneio comparando quatro modelos populares de uplift (S-learner, T-learner, X-learner e Causal Forest) em dados sintéticos e semissintéticos usando a métrica PEHE. O artigo explica as arquiteturas, pontos fortes e fracos dos modelos através de uma analogia temática de futebol, culminando em uma fase de grupos e chaveamento eliminatório. O código está disponível no GitHub para reprodução.
O artigo, escrito por Grigory Kryukov, analista da equipe de confiança e segurança da Avito, apresenta um campeonato entre quatro modelos de uplift: S-learner, T-learner, X-learner e Causal Forest. Usando uma analogia com a Copa do Mundo de futebol, o autor descreve a arquitetura de cada modelo: S-learner treina um único modelo com o tratamento como característica; T-learner treina modelos separados para os grupos de tratamento e controle; X-learner adiciona um segundo estágio de pseudo-efeitos e um modelo de propensão; Causal Forest adapta a floresta aleatória para otimizar diretamente os efeitos heterogêneos do tratamento. O torneio usa dados sintéticos (onde os verdadeiros efeitos individuais do tratamento são conhecidos) e dados semi-sintéticos para medir a qualidade do modelo por meio da métrica PEHE (Erro Quadrático Médio de Efeito de Tratamento Individual Previsto). A fase de grupos coloca os modelos uns contra os outros em dados sintéticos, seguida por uma fase eliminatória. O artigo conclui com os resultados: Causal Forest vence o campeonato, sendo o mais robusto em todos os cenários, enquanto X-learner mostra força em tarefas não lineares, mas é complexo. O código completo é fornecido no GitHub.
Fonte: Habr — хаб ML —
original
