मैंने गंदे डेटा पर एंटी-स्कैम बॉट कैसे बनाया: डिटेक्टर, टाइपिफायर और रास्ते में आने वाली बाधाएँ
OpenAI
लेखक क्रिप्टो चैट के लिए एंटी-स्कैम बॉट बनाने का वर्णन करता है, जो सहायता अनुरोधों का पता लगाने के लिए एक क्लासिफायर और समस्या के प्रकार को निर्धारित करने के लिए एक टाइपिफायर का उपयोग करता है। मुख्य सबक में डेटासेट को बेहतर बनाने के लिए एक्टिव लर्निंग का उपयोग करना, विश्वसनीय मेट्रिक्स के लिए एक गोल्डन सेट को फ्रीज करना, और अनावश्यक जटिलता से बचना शामिल है।
यह परियोजना क्रिप्टो चैट रूम में घोटालेबाजों की समस्या का समाधान करती है, जो सार्वजनिक संदेश पढ़ते हैं और फिर उपयोगकर्ताओं को मदद मांगने के लिए निजी संदेश भेजते हैं। बॉट सार्वजनिक मदद अनुरोधों का पता लगाता है और चेतावनी तथा असली सहायता के लिंक के साथ प्रतिक्रिया देता है। पहली चुनौती लेबल वाले डेटासेट के बिना एक क्लासिफायर बनाना था। प्रारंभिक regex-आधारित डेटा संग्रह ने मॉडल की अनदेखी वाक्यांशों को सामान्यीकृत करने की क्षमता को सीमित कर दिया। सक्रिय शिक्षण का उपयोग करके अनिश्चित उदाहरणों को पुनरावृत्त रूप से जोड़ा गया, जिससे सकारात्मक सेट 830 से बढ़कर 1176 हो गया। टाइपो और स्लैंग के प्रति मजबूती सुधारने के लिए निकट-डुप्लिकेट बनाए रखे गए। वर्गीकरण मानदंड 'मदद अनुरोध' से बदलकर 'टीका-उपयुक्त' कर दिया गया ताकि साधारण प्रश्नों पर ट्रिगर न हो। बदलते डेटासेट पर क्रॉस-वैलिडेशन ने भ्रामक मेट्रिक्स दिए; 245 संदेशों के जमे हुए गोल्डन सेट ने वास्तविक सुधारों का खुलासा किया, जिसमें रिकॉल 0.50 से बढ़कर 0.78 हो गया। वास्तविक ट्रैफिक पर एक अलग परीक्षण ने दिखाया कि थ्रेशोल्ड के आधार पर सटीकता 0.74 से 0.87 तक समायोज्य है। टाइपिफायर (समस्या प्रकार) को सरल रखा गया (लॉजिस्टिक रिग्रेशन) ताकि अति-जटिलता न हो। सिस्टम डिटेक्टर और आरएजी दोनों के लिए एक ही बहुभाषी एम्बेडिंग मॉडल का उपयोग करता है, जो संसाधन बचाने के लिए एक समझौता है लेकिन आरएजी रिकॉल को सीमित कर सकता है। आर्किटेक्चर एक अलग फास्टएपीआई सेवा है जो SQLite का उपयोग करती है, जिसे प्रोडक्शन बॉट द्वारा फायर-एंड-फॉरगेट तरीके से बुलाया जाता है, और सुरक्षित परीक्षण के लिए एक शैडो मोड भी है।
स्रोत: Habr — хаб ML —
मूल
