研究 🇷🇺 24.07.2026 03:04

アップリフトモデル選手権:合成および半合成データでS-learner、T-learner、X-learner、Causal ForestをPEHE指標でテスト

Avitoのアナリストが、4つの人気アップリフトモデル(S-learner、T-learner、X-learner、Causal Forest)を合成データと半合成データでPEHE指標を用いて比較するトーナメントを実施しました。記事では、サッカーをテーマにした例えを用いて各モデルのアーキテクチャ、強み、弱みを解説し、グループステージとノックアウトブラケットで締めくくっています。コードはGitHubで公開されており、再現可能です。
Avitoのトラスト&セーフティチームのアナリスト、Grigory Kryukov氏による記事では、4つのアップリフトモデル、S-learner、T-learner、X-learner、Causal Forestによる選手権が紹介されています。サッカーワールドカップのアナロジーを用いて、各モデルのアーキテクチャが説明されています。S-learnerは治療を特徴量として単一のモデルを訓練し、T-learnerは治療群と対照群に対して別々のモデルを訓練し、X-learnerは第二段階として疑似効果と傾向スコアモデルを追加し、Causal Forestはランダムフォレストを適応させて直接的に不均一な治療効果を最適化します。このトーナメントでは、真の個別治療効果が既知の合成データと半合成データを使用し、PEHEメトリックを用いてモデルの品質を測定します。グループステージでは合成データでモデル同士が対戦し、その後ノックアウトステージに進みます。記事の結論として、Causal Forestが全シナリオで最もロバストであるとして優勝し、X-learnerは非線形タスクで強みを示すものの複雑であると述べられています。完全なコードはGitHubで公開されています。
出典: Habr — хаб ML — 原文
関連記事 ↓
新着ニュース