Matemáticas de Clustering: Entendiendo el Agrupamiento Inteligente de Datos con Nuestro Sistema de Detección de Anomalías en Logs. Parte 1
Andrey Basov, responsable de soporte técnico en MWS, describe la arquitectura de un nuevo sistema para analizar la salud del producto que detecta anomalías en los logs. El sistema utiliza vectorización basada en LLM, reducción de dimensionalidad con PCA y clustering dinámico con adaptación bayesiana y métricas de MST. Esta es la primera parte de una serie que explica las matemáticas y técnicas subyacentes.
Andrey Basov, responsable del equipo de soporte técnico del flujo de productos y servicios corporativos en MWS, describe un nuevo sistema para analizar la salud de los productos que él y sus colegas desarrollaron después de reelaborar su enfoque anterior de detección de anomalías en registros. El sistema es una arquitectura de microservicios con un diseño de procesamiento dirigido por eventos e incremental, que comprende componentes como ml-log-anomaly-cluster-manager-detector para la recepción de registros, vectorización, agrupamiento y actualización del estado de los clústeres; ml-log-anomaly-cluster-manager-retrain para la reconstrucción periódica de los clústeres; ml-log-anomaly-cluster-manager-cleaner para archivar y eliminar datos obsoletos; y ml-log-anomaly-cluster-manager-exporter para exportar resultados a sistemas de monitoreo como Grafana y OpenSearch. Los servicios se comunican a través de almacenes de datos compartidos: Qdrant almacena vectores de registros (incrustaciones BGEM3 de 768 dimensiones) y metadatos de clústeres (centroides, límites, parámetros bayesianos, métricas MST, indicadores), mientras que PostgreSQL gestiona la configuración, el estado del proceso y los datos históricos. El flujo de datos implica recuperar registros de OpenSearch, normalizarlos, deduplicarlos, vectorizarlos mediante LLM (BGEM3), reducir la dimensionalidad con PCA adaptativo y luego agruparlos usando distancia coseno para encontrar el clúster más cercano; si la distancia supera el límite adaptativo, el punto se marca como anomalía y se almacena para el procesamiento nocturno. Se utiliza HDBSCAN para construir nuevos clústeres a partir de anomalías durante las reconstrucciones nocturnas. Las matemáticas del sistema están integradas en el modelo de objetos del clúster, lo que convierte a cada clúster en un agente autoadaptativo con estado interno, estadísticas, nombre y comportamiento, lo que permite el ajuste dinámico de límites, la adaptación bayesiana de umbrales, el monitoreo de velocidad y aceleración del centroide, la estimación de densidad basada en MST y actualizaciones agregadas incrementales. El artículo también cubre conceptos fundamentales de álgebra lineal: vectores, operaciones vectoriales, producto escalar y norma euclidiana, que son esenciales para comprender los métodos de agrupamiento.
Fuente: Хабр — Data Mining —
original
