研究应用 🇷🇺 01.08.2026 15:05

聚类数学:理解我们日志异常检测系统中的智能数据聚类。第一部分

MWS技术支持负责人安德烈·巴索夫描述了一个用于分析产品健康状况的新系统的架构,该系统能检测日志中的异常。该系统使用基于大语言模型(LLM)的向量化、主成分分析(PCA)降维,以及带有贝叶斯自适应和最小生成树(MST)度量的动态聚类。这是系列文章的第一部分,解释了底层数学和技术。
MWS企业产品与服务流技术支持团队负责人安德烈·巴索夫介绍了他们团队在重新设计原有日志异常检测方法后开发的一套新产品健康分析系统。该系统采用微服务架构,具备事件驱动和增量处理设计,包含日志接收、向量化、聚类及簇状态更新的ml-log-anomaly-cluster-manager-detector组件,周期性重建簇的ml-log-anomaly-cluster-manager-retrain组件,负责归档和删除过期数据的ml-log-anomaly-cluster-manager-cleaner组件,以及将结果导出至Grafana和OpenSearch等监控系统的ml-log-anomaly-cluster-manager-exporter组件。这些服务通过共享数据存储进行通信:Qdrant存储日志向量(768维BGEM3嵌入)和簇元数据(质心、边界、贝叶斯参数、最小生成树指标、标志),而PostgreSQL管理配置、处理状态和历史数据。数据流包括从OpenSearch检索日志,进行标准化、去重、通过大型语言模型(BGEM3)向量化,使用自适应主成分分析进行降维,然后通过余弦距离聚类找到最近的簇;若距离超过自适应边界,该点被标记为异常并存储以供夜间处理。夜间重建时使用HDBSCAN从异常中构建新簇。系统的数学原理被整合到簇的对象模型中,使每个簇成为一个自调节的智能体,具备内部状态、统计信息、名称和行为,能够实现动态边界调整、贝叶斯阈值自适应、质心速度和加速度监控、基于最小生成树的密度估计以及增量聚合更新。文章还涵盖了基础线性代数概念:向量、向量运算、点积和欧几里得范数,这些对于理解聚类方法至关重要。
来源: Хабр — Data Mining — 原文
我们之前关于此话题的帖子 ↓
最新新闻