Forschung 🇷🇺 24.07.2026 03:04

Turnier der Uplift-Modelle: S-learner, T-learner, X-learner und Causal Forest auf synthetischen und semisynthetischen Daten mit PEHE-Metrik getestet

Ein Analyst von Avito führte einen Turniervergleich zwischen vier populären Uplift-Modellen (S-learner, T-learner, X-learner, Causal Forest) auf synthetischen und semisynthetischen Daten unter Verwendung der PEHE-Metrik durch. Der Artikel erklärt die Architektur, Stärken und Schwächen der Modelle anhand einer Fußball-Analogie und gipfelt in einer Gruppenphase und einer K.O.-Runde. Der Code ist auf GitHub zur Nachvollziehbarkeit verfügbar.
Der Artikel, verfasst von Grigory Kryukov, einem Analysten im Team für Vertrauen und Sicherheit von Avito, präsentiert eine Meisterschaft unter vier Uplift-Modellen: S-Learner, T-Learner, X-Learner und Causal Forest. In Anlehnung an eine Fußball-Weltmeisterschaft beschreibt der Autor die Architektur jedes Modells: Der S-Learner trainiert ein einzelnes Modell mit der Behandlung als Merkmal; der T-Learner trainiert separate Modelle für Behandlungs- und Kontrollgruppe; der X-Learner fügt eine zweite Stufe von Pseudo-Effekten und ein Propensity-Modell hinzu; Causal Forest passt Random Forest an, um direkt auf heterogene Behandlungseffekte zu optimieren. Das Turnier verwendet synthetische Daten (bei denen die wahren individuellen Behandlungseffekte bekannt sind) und halbsynthetische Daten, um die Modellqualität anhand der PEHE-Metrik zu messen. Die Gruppenphase stellt die Modelle auf synthetischen Daten gegeneinander an, gefolgt von einer K.o.-Phase. Der Artikel schließt mit Ergebnissen: Causal Forest gewinnt die Meisterschaft, da es am robustesten über verschiedene Szenarien hinweg ist, während der X-Learner Stärke bei nichtlinearen Aufgaben zeigt, aber komplex ist. Der vollständige Code steht auf GitHub zur Verfügung.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten