클러스터 수학: 로그 이상 감지 시스템을 통한 스마트 데이터 클러스터링 이해하기. 1부
MWS의 기술 지원 책임자 안드레이 바소프가 로그에서 이상을 감지하는 제품 상태 분석을 위한 새로운 시스템의 아키텍처를 설명합니다. 이 시스템은 LLM 기반 벡터화, PCA 차원 축소, 베이지안 적응 및 MST 메트릭을 사용한 동적 클러스터링을 활용합니다. 이 시리즈의 첫 번째 부분으로, 기반이 되는 수학과 기법을 설명합니다.
MWS公司企业产品和服务流技术支持团队负责人安德烈·巴索夫介绍了他和同事们在重新设计之前的日志异常检测方法后开发的一套新的产品健康分析系统。该系统采用微服务架构,具有事件驱动和增量处理设计,包含多个组件:ml-log-anomaly-cluster-manager-detector负责日志接收、向量化、聚类和集群状态更新;ml-log-anomaly-cluster-manager-retrain定期重建集群;ml-log-anomaly-cluster-manager-cleaner负责归档和删除过时数据;ml-log-anomaly-cluster-manager-exporter将结果导出到Grafana和OpenSearch等监控系统。服务通过共享数据存储进行通信:Qdrant存储日志向量(768维BGEM3嵌入)和集群元数据(质心、边界、贝叶斯参数、MST度量、标志),而PostgreSQL管理配置、进程状态和历史数据。数据流涉及从OpenSearch检索日志,进行标准化、去重,通过LLM(BGEM3)向量化,使用自适应PCA降维,然后使用余弦距离进行聚类以找到最近的集群;如果距离超过自适应边界,则该点被标记为异常并存储以供夜间处理。在夜间重建中,使用HDBSCAN从异常中构建新集群。系统的数学原理融入集群对象模型中,使每个集群成为一个自调优代理,具有内部状态、统计信息、名称和行为,能够动态调整边界、贝叶斯阈值适应、质心速度和加速度监控、基于MST的密度估计以及增量聚合更新。文章还涵盖了基础线性代数概念:向量、向量运算、标量积和欧几里得范数,这些对于理解聚类方法至关重要。
출처: Хабр — Data Mining —
원문
