研究アプリケーション 🇷🇺 01.08.2026 15:05

クラスタ数学:当社のログ異常検知システムによるスマートデータクラスタリングの理解 第1部

MWSのテクニカルサポート責任者であるAndrey Basov氏が、製品の健全性を分析しログ内の異常を検出する新しいシステムのアーキテクチャについて説明します。このシステムは、LLMベースのベクトル化、PCA次元削減、ベイズ適応とMSTメトリクスを用いた動的クラスタリングを採用しています。これは、その背後にある数学と技術を解説するシリーズの第1部です。
MWSの法人向け製品・サービス部門の技術サポートチームを率いるAndrey Basov氏が、同氏と同僚が以前のログ異常検知アプローチを見直した後に開発した、製品の健全性を分析する新しいシステムについて説明しています。このシステムは、マイクロサービスアーキテクチャであり、イベント駆動かつ段階的な処理設計を採用しています。コンポーネントには、ログの受信、ベクトル化、クラスタリング、クラスタ状態の更新を行うml-log-anomaly-cluster-manager-detector、定期的なクラスタ再構築を行うml-log-anomaly-cluster-manager-retrain、古いデータのアーカイブと削除を行うml-log-anomaly-cluster-manager-cleaner、結果をGrafanaやOpenSearchなどの監視システムにエクスポートするml-log-anomaly-cluster-manager-exporterが含まれます。サービスは共有データストアを介して通信します。Qdrantはログベクトル(768次元のBGEM3埋め込み)とクラスタメタデータ(セントロイド、境界、ベイズパラメータ、MSTメトリクス、フラグ)を格納し、PostgreSQLは設定、プロセス状態、履歴データを管理します。データフローは、OpenSearchからのログ取得、正規化、重複排除、LLM(BGEM3)によるベクトル化、適応型主成分分析(PCA)による次元削減、その後、コサイン距離を使用したクラスタリングによる最近傍クラスタの特定を含みます。距離が適応境界を超える場合、その点は異常としてマークされ、夜間処理のために保存されます。夜間の再構築では、HDBSCANを使用して異常から新しいクラスタを構築します。システムの数学はクラスタのオブジェクトモデルに統合されており、各クラスタは内部状態、統計、名前、動作を持つ自己調整エージェントとなり、動的な境界調整、ベイズ閾値適応、セントロイドの速度と加速度の監視、MSTベースの密度推定、増分集計更新を可能にします。この記事では、クラスタリング手法を理解するために不可欠な、ベクトル、ベクトル演算、スカラー積、ユークリッドノルムといった線形代数の基礎概念についても説明しています。
出典: Хабр — Data Mining — 原文
関連記事 ↓
新着ニュース