RechercheApplications 🇷🇺 01.08.2026 15:05

Cluster Mathematics : comprendre le regroupement intelligent des données avec notre système de détection d'anomalies dans les journaux. Partie 1

Andrey Basov, responsable du support technique chez MWS, décrit l'architecture d'un nouveau système d'analyse de la santé des produits qui détecte les anomalies dans les journaux (logs). Le système utilise la vectorisation basée sur les grands modèles de langage (LLM), la réduction de dimensionnalité par analyse en composantes principales (ACP), et un regroupement dynamique avec adaptation bayésienne et métriques basées sur les arbres couvrants minimaux (MST). Ceci est la première partie d'une série expliquant les mathématiques et techniques sous-jacentes.
Andrey Basov, responsable de l'équipe de support technique pour le flux des produits et services d'entreprise chez MWS, décrit un nouveau système d'analyse de la santé des produits qu'il a développé avec ses collègues après avoir retravaillé leur précédente approche de détection d'anomalies dans les journaux. Le système est une architecture de microservices avec un traitement événementiel et incrémental, comprenant des composants tels que ml-log-anomaly-cluster-manager-detector pour la réception des journaux, la vectorisation, le clustering et la mise à jour de l'état des clusters ; ml-log-anomaly-cluster-manager-retrain pour la reconstruction périodique des clusters ; ml-log-anomaly-cluster-manager-cleaner pour l'archivage et la suppression des données obsolètes ; et ml-log-anomaly-cluster-manager-exporter pour exporter les résultats vers des systèmes de surveillance comme Grafana et OpenSearch. Les services communiquent via des magasins de données partagés : Qdrant stocke les vecteurs de journaux (embeddings BGEM3 à 768 dimensions) et les métadonnées de cluster (centroïdes, limites, paramètres bayésiens, métriques MST, indicateurs), tandis que PostgreSQL gère la configuration, l'état des processus et les données historiques. Le flux de données consiste à récupérer les journaux depuis OpenSearch, les normaliser, les dédupliquer, les vectoriser via un LLM (BGEM3), réduire la dimensionnalité avec une ACP adaptative, puis effectuer un clustering en utilisant la distance cosinus pour trouver le cluster le plus proche ; si la distance dépasse la limite adaptative, le point est marqué comme anomalie et stocké pour un traitement nocturne. HDBSCAN est utilisé pour construire de nouveaux clusters à partir des anomalies lors des reconstructions nocturnes. Les mathématiques du système sont intégrées dans le modèle objet du cluster, faisant de chaque cluster un agent auto-ajustable avec état interne, statistiques, nom et comportement, permettant un ajustement dynamique des limites, une adaptation bayésienne des seuils, une surveillance de la vitesse et de l'accélération du centroïde, une estimation de densité basée sur MST et des mises à jour incrémentales d'agrégats. L'article couvre également les concepts fondamentaux de l'algèbre linéaire : vecteurs, opérations vectorielles, produit scalaire et norme euclidienne, essentiels pour comprendre les méthodes de clustering.
Source: Хабр — Data Mining — original
Nos articles précédents sur ce sujet ↓
Infos fraîches