AraştırmaUygulamalar 🇷🇺 01.08.2026 15:05

Küme Matematiği: Log Anomali Tespit Sistemimizle Akıllı Veri Kümelemeyi Anlamak. Bölüm 1

MWS Teknik Destek Müdürü Andrey Basov, ürün sağlığını analiz eden ve loglardaki anormallikleri tespit eden yeni sistemin mimarisini anlatıyor. Sistem, büyük dil modeli tabanlı vektörizasyon, temel bileşen analizi (PCA) ile boyut azaltma, Bayes uyarlaması ve minimum yayılan ağaç (MST) metrikleriyle dinamik kümeleme kullanıyor. Bu, altta yatan matematik ve teknikleri açıklayan serinin ilk bölümüdür.
Andrey Basov, MWS kurumsal ürün ve hizmetler akışı teknik destek ekibinin başkanı, kendisinin ve meslektaşlarının önceki log anomali tespiti yaklaşımlarını yeniden işledikten sonra geliştirdikleri ürün sağlığını analiz etmek için yeni bir sistemi anlatıyor. Sistem, mikroservis mimarisine sahip, olay odaklı ve artımlı işleme tasarımına sahip olup; log alma, vektörleştirme, kümeleme ve küme durumu güncellemeleri için ml-log-anomaly-cluster-manager-detector; periyodik küme yeniden oluşturma için ml-log-anomaly-cluster-manager-retrain; eski verileri arşivleme ve silme için ml-log-anomaly-cluster-manager-cleaner; ve sonuçları Grafana ve OpenSearch gibi izleme sistemlerine dışa aktarma için ml-log-anomaly-cluster-manager-exporter bileşenlerini içerir. Servisler, paylaşılan veri depoları aracılığıyla iletişim kurar: Qdrant, log vektörlerini (768 boyutlu BGEM3 gömme) ve küme meta verilerini (merkezler, sınırlar, Bayes parametreleri, MST metrikleri, bayraklar) depolar; PostgreSQL ise yapılandırma, süreç durumu ve geçmiş verileri yönetir. Veri akışı, OpenSearch'ten logların alınmasını, normalleştirilmesini, yinelenenlerin kaldırılmasını, LLM (BGEM3) aracılığıyla vektörleştirilmesini, uyarlanabilir PCA ile boyut azaltılmasını ve ardından kosinüs mesafesi kullanılarak en yakın kümeyi bulmak için kümeleme yapılmasını içerir; mesafe uyarlanabilir sınırı aşarsa, nokta anomali olarak işaretlenir ve gece işleme için saklanır. HDBSCAN, gece yeniden oluşturma sırasında anormalliklerden yeni kümeler oluşturmak için kullanılır. Sistemin matematiği, kümenin nesne modeline entegre edilmiştir; böylece her küme, iç durumu, istatistikleri, adı ve davranışı olan kendi kendini ayarlayan bir ajan haline gelir; dinamik sınır ayarlaması, Bayes eşik uyarlaması, merkez hızı ve ivme izleme, MST tabanlı yoğunluk tahmini ve artımlı toplu güncellemeler sağlar. Makale ayrıca, kümeleme yöntemlerini anlamak için gerekli olan temel doğrusal cebir kavramlarını da kapsar: vektörler, vektör işlemleri, skaler çarpım ve Öklid normu.
Kaynak: Хабр — Data Mining — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler