Onderzoek 🇷🇺 24.07.2026 03:04

Toernooi tussen Uplift-modellen: Testen van S-learner, T-learner, X-learner en Causal Forest op Synthetische en Semi-Synthetische Data met PEHE-metriek

Een analist van Avito hield een toernooi waarin vier populaire uplift-modellen (S-learner, T-learner, X-learner, Causal Forest) werden vergeleken op synthetische en semi-synthetische data met behulp van de PEHE-metriek. Het artikel legt de architecturen, sterke en zwakke punten van de modellen uit aan de hand van een voetbalthema, met een groepsfase en een knock-outfase. De code is beschikbaar op GitHub voor reproductie.
Het artikel, geschreven door Grigory Kryukov, een analist bij het team voor vertrouwen en veiligheid van Avito, presenteert een kampioenschap tussen vier uplift-modellen: S-learner, T-learner, X-learner en Causal Forest. Gebruikmakend van een analogie met het WK voetbal beschrijft de auteur de architectuur van elk model: S-learner traint één enkel model met behandeling als kenmerk; T-learner traint aparte modellen voor de behandelings- en controlegroepen; X-learner voegt een tweede fase van pseudo-effecten en een neigingsmodel toe; Causal Forest past random forest aan om direct te optimaliseren voor heterogene behandelingseffecten. Het toernooi gebruikt synthetische gegevens (waar individuele behandelingseffecten bekend zijn) en semi-synthetische gegevens om de modelkwaliteit te meten via de 'PEHE'-metriek. De groepsfase zet modellen tegen elkaar op met synthetische gegevens, gevolgd door een knock-outfase. Het artikel besluit met resultaten: Causal Forest wint het kampioenschap, omdat het het meest robuust is in verschillende scenario's, terwijl X-learner sterk is bij niet-lineaire taken maar complex is. De volledige code is beschikbaar op GitHub.
Bron: Habr — хаб ML — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws