क्लस्टर गणित: हमारे लॉग विसंगति पहचान प्रणाली के साथ स्मार्ट डेटा क्लस्टरिंग को समझना। भाग 1
MWS में तकनीकी सहायता के प्रमुख आंद्रेई बसोव, उत्पाद स्वास्थ्य का विश्लेषण करने वाली एक नई प्रणाली की वास्तुकला का वर्णन करते हैं जो लॉग में विसंगतियों का पता लगाती है। यह प्रणाली एलएलएम-आधारित वेक्टरीकरण, पीसीए आयामीता में कमी, और बायेसियन अनुकूलन और एमएसटी मेट्रिक्स के साथ गतिशील क्लस्टरिंग का उपयोग करती है। यह श्रृंखला का पहला भाग है जो अंतर्निहित गणित और तकनीकों की व्याख्या करता है।
एमडब्ल्यूएस में कॉर्पोरेट उत्पादों और सेवाओं की धारा के तकनीकी समर्थन टीम के प्रमुख आंद्रेई बासोव, उत्पाद स्वास्थ्य के विश्लेषण के लिए एक नई प्रणाली का वर्णन करते हैं, जिसे उन्होंने और उनके सहयोगियों ने लॉग विसंगति का पता लगाने के अपने पिछले दृष्टिकोण को फिर से तैयार करने के बाद विकसित किया है। यह प्रणाली एक माइक्रोसर्विस आर्किटेक्चर है जिसमें इवेंट-संचालित और वृद्धिशील प्रसंस्करण डिज़ाइन है, जिसमें लॉग रिसेप्शन, वेक्टराइजेशन, क्लस्टरिंग और क्लस्टर स्थिति अपडेट के लिए ml-log-anomaly-cluster-manager-detector जैसे घटक शामिल हैं; आवधिक क्लस्टर पुनर्निर्माण के लिए ml-log-anomaly-cluster-manager-retrain; पुराने डेटा को संग्रहीत करने और हटाने के लिए ml-log-anomaly-cluster-manager-cleaner; और परिणामों को ग्राफाना और ओपनसर्च जैसी निगरानी प्रणालियों में निर्यात करने के लिए ml-log-anomaly-cluster-manager-exporter। सेवाएं साझा डेटा स्टोर के माध्यम से संचार करती हैं: Qdrant लॉग वैक्टर (768-आयामी BGEM3 एम्बेडिंग) और क्लस्टर मेटाडेटा (केन्द्रक, सीमाएं, बायेसियन पैरामीटर, MST मेट्रिक्स, फ्लैग) संग्रहीत करता है, जबकि PostgreSQL कॉन्फ़िगरेशन, प्रक्रिया स्थिति और ऐतिहासिक डेटा का प्रबंधन करता है। डेटा प्रवाह में ओपनसर्च से लॉग पुनर्प्राप्त करना, सामान्यीकरण, डीडुप्लीकेशन, एलएलएम (BGEM3) के माध्यम से वेक्टराइजेशन, अनुकूली पीसीए के साथ आयाम कमी, फिर निकटतम क्लस्टर खोजने के लिए कोसाइन दूरी का उपयोग करके क्लस्टरिंग शामिल है; यदि दूरी अनुकूली सीमा से अधिक है, तो बिंदु को विसंगति के रूप में चिह्नित किया जाता है और रात्रि प्रसंस्करण के लिए संग्रहीत किया जाता है। रात्रि पुनर्निर्माण के दौरान विसंगतियों से नए क्लस्टर बनाने के लिए HDBSCAN का उपयोग किया जाता है। प्रणाली का गणित क्लस्टर के ऑब्जेक्ट मॉडल में एकीकृत है, जिससे प्रत्येक क्लस्टर आंतरिक स्थिति, आँकड़े, नाम और व्यवहार के साथ एक स्व-ट्यूनिंग एजेंट बन जाता है, जो गतिशील सीमा समायोजन, बायेसियन थ्रेशोल्ड अनुकूलन, केन्द्रक वेग और त्वरण निगरानी, MST-आधारित घनत्व अनुमान और वृद्धिशील समग्र अपडेट को सक्षम बनाता है। लेख मौलिक रैखिक बीजगणित अवधारणाओं को भी शामिल करता है: वैक्टर, वेक्टर संचालन, अदिश गुणन, और यूक्लिडियन मानदंड, जो क्लस्टरिंग विधियों को समझने के लिए आवश्यक हैं।
स्रोत: Хабр — Data Mining —
मूल
