بطولة بين نماذج الرفع: اختبار S-learner و T-learner و X-learner و Causal Forest على بيانات اصطناعية وشبه اصطناعية باستخدام مقياس PEHE
أجرى محلل من Avito بطولة تقارن أربعة نماذج رفع شائعة (S-learner، T-learner، X-learner، Causal Forest) على بيانات اصطناعية وشبه اصطناعية باستخدام مقياس PEHE. تشرح المقالة هياكل النماذج ونقاط قوتها وضعفها من خلال تشبيه قائم على كرة القدم، وتنتهي بمرحلة مجموعات وأدوار إقصائية. الكود متاح على GitHub لإعادة الإنتاج.
المقال، الذي كتبه غريغوري كريوكوف، المحلل في فريق الثقة والسلامة في Avito، يقدم بطولة بين أربعة نماذج لرفع المستوى: S-learner و T-learner و X-learner و Causal Forest. باستخدام تشبيه كأس العالم لكرة القدم، يصف المؤلف بنية كل نموذج: S-learner يدرب نموذجًا واحدًا مع المعالجة كميزة؛ T-learner يدرب نماذج منفصلة لمجموعات المعالجة والتحكم؛ X-learner يضيف مرحلة ثانية من التأثيرات الزائفة ونموذج الميول؛ Causal Forest يكيف الغابة العشوائية لتحسين التأثيرات العلاجية غير المتجانسة بشكل مباشر. تستخدم البطولة بيانات اصطناعية (حيث تكون التأثيرات العلاجية الفردية الحقيقية معروفة) وبيانات شبه اصطناعية لقياس جودة النموذج عبر مقياس PEHE. تقوم مرحلة المجموعات بمواجهة النماذج ضد بعضها البعض على البيانات الاصطناعية، تليها مرحلة خروج المغلوب. يختتم المقال بالنتائج: يفوز Causal Forest بالبطولة، كونه الأكثر متانة عبر السيناريوهات، بينما يظهر X-learner قوة في المهام غير الخطية ولكنه معقد. يتم توفير الكود الكامل على GitHub.
المصدر: Habr — хаб ML —
الأصلي
