Nostomallien mestaruusturnaus: S-learnerin, T-learnerin, X-learnerin ja Causal Forestin testaus synteettisellä ja puolisynteettisellä datalla PEHE-mittarilla
Aviton analyytikko järjesti turnauksen, jossa verrattiin neljää suosittua nostomallia (S-learner, T-learner, X-learner ja Causal Forest) synteettisellä ja puolisynteettisellä datalla käyttäen PEHE-mittaria. Artikkeli selittää mallien arkkitehtuurit, vahvuudet ja heikkoudet jalkapalloaiheisen analogian avulla huipentuen lohkovaiheeseen ja pudotuspelikaavioon. Koodi on saatavilla GitHubissa toistamista varten.
Artikkelissa Grigory Kryukov, Aviton luottamus- ja turvatiimin analyytikko, esittelee mestaruuskilpailun neljän lift-mallin välillä: S-learner, T-learner, X-learner ja Causal Forest. Käyttäen jalkapallon maailmanmestaruusturnauksen analogiaa kirjoittaja kuvaa kunkin mallin arkkitehtuuria: S-learner kouluttaa yhden mallin, jossa käsittely on piirteenä; T-learner kouluttaa erilliset mallit käsittely- ja kontrolliryhmille; X-learner lisää toisen vaiheen pseudoefektejä ja taipumusmallin; Causal Forest mukauttaa satunnaismetsää optimoimaan suoraan heterogeenisia käsittelyvaikutuksia. Turnauksessa käytetään synteettistä dataa (jossa todelliset yksilölliset käsittelyvaikutukset tunnetaan) ja puolisynteettistä dataa mallien laadun mittaamiseen PEHE-metriikalla. Lohkovaiheessa mallit kilpailevat toisiaan vastaan synteettisellä datalla, jota seuraa pudotuspelivaihe. Artikkeli päättyy tuloksiin: Causal Forest voittaa mestaruuden ollen vankin eri skenaarioissa, kun taas X-learner osoittaa vahvuutta epälineaarisissa tehtävissä, mutta on monimutkainen. Täydellinen koodi on saatavilla GitHubissa.
Lähde: Habr — хаб ML —
Alkuperäinen
