अपलिफ्ट मॉडल्स के बीच चैंपियनशिप: PEHE मीट्रिक के साथ सिंथेटिक और सेमी-सिंथेटिक डेटा पर S-लर्नर, T-लर्नर, X-लर्नर और कॉज़ल फ़ॉरेस्ट का परीक्षण
एविटो के एक विश्लेषक ने PEHE मीट्रिक का उपयोग करके सिंथेटिक और सेमी-सिंथेटिक डेटा पर चार लोकप्रिय अपलिफ्ट मॉडलों (S-लर्नर, T-लर्नर, X-लर्नर, कॉज़ल फ़ॉरेस्ट) की तुलना करते हुए एक टूर्नामेंट आयोजित किया। लेख फुटबॉल-थीम वाले सादृश्य के माध्यम से मॉडलों की आर्किटेक्चर, ताकत और कमजोरियों को समझाता है, जो एक ग्रुप स्टेज और नॉकआउट ब्रैकेट में समाप्त होता है। पुनरुत्पादन के लिए कोड GitHub पर उपलब्ध है।
यह लेख अविटो की ट्रस्ट एंड सेफ्टी टीम के विश्लेषक ग्रिगोरी क्रुकोव द्वारा लिखा गया है, जो चार अपलिफ्ट मॉडलों - एस-लर्नर, टी-लर्नर, एक्स-लर्नर और कॉज़ल फ़ॉरेस्ट के बीच एक चैम्पियनशिप प्रस्तुत करता है। फुटबॉल विश्व कप की उपमा का उपयोग करते हुए, लेखक प्रत्येक मॉडल की संरचना का वर्णन करता है: एस-लर्नर ट्रीटमेंट को एक फीचर के रूप में लेकर एक ही मॉडल प्रशिक्षित करता है; टी-लर्नर ट्रीटमेंट और कंट्रोल समूहों के लिए अलग-अलग मॉडल प्रशिक्षित करता है; एक्स-लर्नर स्यूडो-इफेक्ट्स और एक प्रोपेंसिटी मॉडल का दूसरा चरण जोड़ता है; कॉज़ल फ़ॉरेस्ट हेटेरोजीनस ट्रीटमेंट इफेक्ट्स के लिए सीधे ऑप्टिमाइज़ करने के लिए रैंडम फ़ॉरेस्ट को अनुकूलित करता है। टूर्नामेंट सिंथेटिक डेटा (जहां वास्तविक व्यक्तिगत ट्रीटमेंट इफेक्ट ज्ञात हैं) और सेमी-सिंथेटिक डेटा का उपयोग करता है ताकि पीईएचई मीट्रिक के माध्यम से मॉडल गुणवत्ता को मापा जा सके। ग्रुप स्टेज में मॉडल सिंथेटिक डेटा पर एक-दूसरे से भिड़ते हैं, उसके बाद नॉकआउट स्टेज होता है। लेख का निष्कर्ष है: कॉज़ल फ़ॉरेस्ट चैम्पियनशिप जीतता है, जो परिदृश्यों में सबसे मजबूत है, जबकि एक्स-लर्नर नॉन-लीनियर कार्यों पर ताकत दिखाता है लेकिन जटिल है। पूरा कोड गिटहब पर उपलब्ध है।
स्रोत: Habr — хаб ML —
मूल
