PesquisaAplicações 🇷🇺 01.08.2026 15:05

Matemática de Cluster: Entendendo o Agrupamento Inteligente de Dados com Nosso Sistema de Detecção de Anomalias em Logs. Parte 1

Andrey Basov, chefe de suporte técnico da MWS, descreve a arquitetura de um novo sistema para analisar a saúde do produto que detecta anomalias em logs. O sistema usa vetorização baseada em LLM, redução de dimensionalidade com PCA e agrupamento dinâmico com adaptação bayesiana e métricas MST. Esta é a primeira parte de uma série que explica a matemática e as técnicas subjacentes.
Andrey Basov, chefe da equipe de suporte técnico para o stream de produtos e serviços corporativos na MWS, descreve um novo sistema para análise da saúde do produto que ele e seus colegas desenvolveram após reformular sua abordagem anterior de detecção de anomalias em logs. O sistema é uma arquitetura de microsserviços com design orientado a eventos e processamento incremental, composto por componentes como ml-log-anomaly-cluster-manager-detector para recepção de logs, vetorização, clustering e atualizações de estado do cluster; ml-log-anomaly-cluster-manager-retrain para reconstrução periódica de clusters; ml-log-anomaly-cluster-manager-cleaner para arquivamento e exclusão de dados desatualizados; e ml-log-anomaly-cluster-manager-exporter para exportar resultados para sistemas de monitoramento como Grafana e OpenSearch. Os serviços se comunicam por meio de armazenamentos de dados compartilhados: Qdrant armazena vetores de logs (embeddings BGEM3 de 768 dimensões) e metadados de clusters (centroides, limites, parâmetros bayesianos, métricas MST, flags), enquanto o PostgreSQL gerencia configuração, estado do processo e dados históricos. O fluxo de dados envolve recuperar logs do OpenSearch, normalizar, deduplicar, vetorizar via LLM (BGEM3), redução de dimensionalidade com PCA adaptativo, e então clustering usando distância de cosseno para encontrar o cluster mais próximo; se a distância exceder o limite adaptativo, o ponto é marcado como anomalia e armazenado para processamento noturno. O HDBSCAN é usado para construir novos clusters a partir de anomalias durante reconstruções noturnas. A matemática do sistema está integrada ao modelo de objeto do cluster, tornando cada cluster um agente autoajustável com estado interno, estatísticas, nome e comportamento, permitindo ajuste dinâmico de limites, adaptação bayesiana de limiares, monitoramento de velocidade e aceleração do centroide, estimativa de densidade baseada em MST e atualizações incrementais de agregados. O artigo também aborda conceitos fundamentais de álgebra linear: vetores, operações vetoriais, produto escalar e norma euclidiana, que são essenciais para entender os métodos de clustering.
Fonte: Хабр — Data Mining — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas