क्यों माइक्रो F1=0.94 एक बेकार क्लासिफायर को छिपा सकता है: मल्टी-लेबल समस्या का विश्लेषण
DeepPavlov
डिस्कॉर्ड के लिए एआई मॉडरेशन के उदाहरण का उपयोग करते हुए, लेख दिखाता है कि समग्र माइक्रो F1 मीट्रिक दुर्लभ लेकिन महत्वपूर्ण वर्गों पर विफलताओं को छिपा सकता है। लेखक मल्टी-लेबल कार्यों में अंधाधुंध KISS सिद्धांत का पालन करने के खिलाफ चेतावनी देता है और बताता है कि क्लास असंतुलन, लॉस फंक्शन का चुनाव और चेकपॉइंट चयन मीट्रिक वास्तविक मॉडल गुणवत्ता को कैसे प्रभावित करते हैं।
लेखक ruBERT tiny2 मॉडल पर आधारित Discord के लिए AI मॉडरेशन विकसित करता है, जिसे 15 लेबलों (SAFE, TOXIC, ADVERTISEMENT, SPAM, SCAM, THREAT, EVASION, FLOOD, और अन्य) के साथ मल्टी-लेबल वर्गीकरण के लिए फाइन-ट्यून किया गया है। डेटासेट में लगभग 10 लाख लेबल किए गए उदाहरण हैं। प्रशिक्षण के बाद, मॉडल ने परीक्षण माइक्रो F1=0.9358 और मैक्रो F1=0.8396 प्राप्त किया — लगभग 0.1 का अंतर प्रत्येक वर्ग के लिए मीट्रिक्स की जाँच करने की आवश्यकता का संकेत देता है। यह पता चला कि दुर्लभ वर्ग (जैसे, EVASION जिसमें 35,000 नमूने हैं) बारंबार वर्गों (जैसे, SAFE जिसमें 400,000 हैं) के समूह में डूब जाते हैं, और माइक्रो F1 उन पर त्रुटियों को प्रतिबिंबित नहीं करता है। असंतुलन का मुकाबला करने के लिए, BCEWithLogitsLoss में pos_weight का उपयोग किया गया था। विस्तृत विश्लेषण से पता चला कि TOXIC का recall≈0.78 है, जिसका अर्थ है कि मॉडल विषाक्त संदेशों का एक महत्वपूर्ण हिस्सा मिस कर देता है। FLOOD और IMAGE_SCAM वर्ग परीक्षण विभाजन में लगभग अनुपस्थित हैं, लेकिन उनका प्रसंस्करण पाठ वर्गीकारक को नहीं, बल्कि सिस्टम के अन्य घटकों को सौंपा गया है। लेखक यह भी नोट करता है कि प्रशिक्षण हानि के आधार पर सर्वोत्तम चेकपॉइंट का चयन करने से ओवरफिटिंग होती है: इष्टतम संस्करण मैक्रो F1 का उपयोग करके पाया गया था, हानि का नहीं। मुख्य निष्कर्ष: KISS सिद्धांत कार्यान्वयन पर लागू होता है, लेकिन कार्य पर नहीं — वर्ग असंतुलन, मीट्रिक अंतर, प्रत्येक वर्ग के लिए अलग से precision/recall, और त्रुटि लागत को अनदेखा नहीं किया जा सकता है। अगला कदम प्रत्येक वर्ग के लिए अलग-अलग थ्रेशोल्ड को कैलिब्रेट करना है।
स्रोत: Habr — хаб NLP —
मूल
