Clusterwiskunde: Slimme dataclustering begrijpen met ons logafwijkingsdetectiesysteem. Deel 1
Andrey Basov, hoofd technische ondersteuning bij MWS, beschrijft de architectuur van een nieuw systeem voor het analyseren van de gezondheid van producten dat afwijkingen in logs detecteert. Het systeem maakt gebruik van op LLM gebaseerde vectorisatie, PCA-dimensiereductie en dynamische clustering met Bayesiaanse adaptatie en MST-metrieken. Dit is het eerste deel van een serie die de onderliggende wiskunde en technieken uitlegt.
Andrey Basov, hoofd van het technische ondersteuningsteam voor de stream van bedrijfsproducten en -diensten bij MWS, beschrijft een nieuw systeem voor het analyseren van de gezondheid van producten dat hij en zijn collega's hebben ontwikkeld na het herwerken van hun eerdere aanpak voor het detecteren van logafwijkingen. Het systeem is een microservice-architectuur met een eventgedreven en incrementele verwerkingsopzet, bestaande uit componenten zoals ml-log-anomaly-cluster-manager-detector voor logontvangst, vectorisatie, clustering en updates van clusterstatus; ml-log-anomaly-cluster-manager-retrain voor periodieke clusterreconstructie; ml-log-anomaly-cluster-manager-cleaner voor het archiveren en verwijderen van verouderde gegevens; en ml-log-anomaly-cluster-manager-exporter voor het exporteren van resultaten naar monitorsystemen zoals Grafana en OpenSearch. De services communiceren via gedeelde gegevensopslag: Qdrant slaat logvectoren op (768-dimensionale BGEM3-embeddings) en clustermetadata (centroïden, grenzen, Bayesiaanse parameters, MST-statistieken, vlaggen), terwijl PostgreSQL configuratie, processtatus en historische gegevens beheert. De gegevensstroom omvat het ophalen van logs uit OpenSearch, normaliseren, dedupliceren, vectoriseren via LLM (BGEM3), dimensionaliteitsreductie met adaptieve PCA, en vervolgens clusteren met behulp van cosinusafstand om het dichtstbijzijnde cluster te vinden; als de afstand de adaptieve grens overschrijdt, wordt het punt als afwijking gemarkeerd en opgeslagen voor nachtelijke verwerking. HDBSCAN wordt gebruikt om tijdens nachtelijke reconstructies nieuwe clusters te bouwen uit afwijkingen. De wiskunde van het systeem is geïntegreerd in het objectmodel van het cluster, waardoor elk cluster een zelfafstellende agent is met interne toestand, statistieken, naam en gedrag, wat dynamische grensaanpassing, Bayesiaanse drempeladaptatie, monitoring van centroïdesnelheid en -versnelling, op MST gebaseerde dichtheidsschatting en incrementele aggregaatupdates mogelijk maakt. Het artikel behandelt ook fundamentele lineaire algebra-concepten: vectoren, vectorbewerkingen, scalair product en Euclidische norm, die essentieel zijn voor het begrijpen van de clustermethoden.
Bron: Хабр — Data Mining —
origineel
