Математика кластеров: как мы построили самоадаптирующуюся систему поиска аномалий в логах с LLM и PCA. Часть 1
Команда MWS переработала систему поиска аномалий в логах, внедрив генеративную LLM и метод главных компонент (PCA). Новая микросервисная архитектура использует динамические границы кластеров, байесовскую адаптацию и графовый анализ (MST) для самодиагностики и прогнозирования.
Андрей Басов, руководитель команды технической поддержки продуктовой линейки Partner Experience Platform в MWS, рассказал о новой версии системы анализа логов. Архитектура построена по принципу event-driven и incremental processing, включает микросервисы ml‑log‑anomaly‑cluster‑manager‑detector, retrain, cleaner и exporter. Данные хранятся в Qdrant (векторы логов и метаданные кластеров) и PostgreSQL (конфигурация, история, статистика). Поток обработки: забор логов из OpenSearch, предобработка (нормализация, дедупликация), векторизация через LLM BGEM3 (768‑мерные эмбеддинги), адаптивное понижение размерности PCA, кластеризация по косинусному расстоянию с динамическими границами и байесовской адаптацией. Если точка не попадает ни в один кластер, она считается аномалией и временно сохраняется для ночного ребилда с помощью HDBSCAN. Каждый кластер — самонастраивающийся агент с внутренней статистикой (центроид, скорость, ускорение, MST-метрики). Система поддерживает самодиагностику: кластер может предупредить о дрейфе, адаптироваться или запросить пересборку. В статье также даётся краткое введение в линейную алгебру для понимания векторных представлений.
- Сокращения
- LLM = Large Language Model — большая языковая модель
- PCA = Principal Component Analysis — метод главных компонент
- MST = Minimum Spanning Tree — минимальное остовное дерево
- ML = Machine Learning — машинное обучение
- HDBSCAN = Hierarchical Density-Based Spatial Clustering of Applications with Noise — иерархическая плотностная пространственная кластеризация с шумом
Источник: Хабр — Data Mining —
оригинал
