Yükseltme Modelleri Arasında Şampiyona: S-öğrenci, T-öğrenci, X-öğrenci ve Nedensel Ormanın PEHE Metriği ile Sentetik ve Yarı-Sentetik Veriler Üzerinde Test Edilmesi
Avito'dan bir analist, dört popüler yükseltme modelini (S-öğrenci, T-öğrenci, X-öğrenci, Nedensel Orman) sentetik ve yarı-sentetik veriler üzerinde PEHE metriğini kullanarak karşılaştıran bir turnuva düzenledi. Makale, modellerin mimarilerini, güçlü ve zayıf yönlerini futbol temalı bir benzetme aracılığıyla açıklıyor ve bir grup aşaması ile eleme tablosuyla sonuçlanıyor. Kod, çoğaltma için GitHub'da mevcut.
Grigory Kryukov'un, Avito'nun güven ve güvenilirlik ekibinde analist olarak kaleme aldığı makale, dört farklı uplift modeli arasında bir şampiyona sunuyor: S-learner, T-learner, X-learner ve Causal Forest. Yazar, futbol Dünya Kupası benzetmesini kullanarak her modelin mimarisini şöyle anlatıyor: S-learner, tedaviyi bir özellik olarak kullanarak tek bir model eğitir; T-learner, tedavi ve kontrol grupları için ayrı modeller eğitir; X-learner, ikinci bir aşamada sahte etkiler ve bir eğilim puanı modeli ekler; Causal Forest ise rastgele ormanı, heterojen tedavi etkilerini doğrudan optimize edecek şekilde uyarlar. Turnuva, gerçek bireysel tedavi etkilerinin bilindiği sentetik veriler ve yarı sentetik veriler kullanarak, model kalitesini PEHE metriği ile ölçer. Grup aşamasında modeller sentetik veriler üzerinde karşı karşıya gelir, ardından eleme aşamasına geçilir. Makale sonuçlarla bitiyor: Causal Forest, senaryolar genelinde en sağlam model olarak şampiyon olurken, X-learner doğrusal olmayan görevlerde güçlü olduğunu ancak karmaşık olduğunu gösteriyor. Kodun tamamı GitHub'da sağlanmıştır.
Kaynak: Habr — хаб ML —
orijinal
