Toán học Phân cụm: Hiểu về Phân cụm Dữ liệu Thông minh với Hệ thống Phát hiện Bất thường Nhật ký của Chúng tôi. Phần 1
Andrey Basov, trưởng bộ phận hỗ trợ kỹ thuật tại MWS, mô tả kiến trúc của một hệ thống mới để phân tích sức khỏe sản phẩm, phát hiện các bất thường trong nhật ký. Hệ thống sử dụng phương pháp vector hóa dựa trên LLM, giảm chiều dữ liệu bằng PCA, và phân cụm động với thích nghi Bayes và các chỉ số MST. Đây là phần đầu của loạt bài giải thích toán học và kỹ thuật nền tảng.
Andrey Basov, trưởng nhóm hỗ trợ kỹ thuật cho các sản phẩm và dịch vụ doanh nghiệp tại MWS, mô tả một hệ thống mới để phân tích tình trạng sức khỏe của sản phẩm mà anh và các đồng nghiệp đã phát triển sau khi thiết kế lại phương pháp phát hiện bất thường trong log trước đó. Hệ thống này là một kiến trúc microservice với thiết kế xử lý theo sự kiện và gia tăng, bao gồm các thành phần như ml-log-anomaly-cluster-manager-detector để nhận log, vector hóa, phân cụm và cập nhật trạng thái cụm; ml-log-anomaly-cluster-manager-retrain để xây dựng lại cụm định kỳ; ml-log-anomaly-cluster-manager-cleaner để lưu trữ và xóa dữ liệu cũ; và ml-log-anomaly-cluster-manager-exporter để xuất kết quả sang các hệ thống giám sát như Grafana và OpenSearch. Các dịch vụ giao tiếp thông qua các kho dữ liệu dùng chung: Qdrant lưu trữ vector log (embedding BGEM3 768 chiều) và siêu dữ liệu cụm (centroid, ranh giới, tham số Bayes, chỉ số MST, cờ), trong khi PostgreSQL quản lý cấu hình, trạng thái xử lý và dữ liệu lịch sử. Luồng dữ liệu bao gồm việc truy xuất log từ OpenSearch, chuẩn hóa, loại bỏ trùng lặp, vector hóa bằng LLM (BGEM3), giảm chiều bằng PCA thích ứng, sau đó phân cụm bằng khoảng cách cosine để tìm cụm gần nhất; nếu khoảng cách vượt quá ranh giới thích ứng, điểm đó được đánh dấu là bất thường và được lưu trữ để xử lý vào ban đêm. HDBSCAN được sử dụng để xây dựng các cụm mới từ các bất thường trong quá trình xây dựng lại hàng đêm. Toán học của hệ thống được tích hợp vào mô hình đối tượng của cụm, khiến mỗi cụm trở thành một tác tử tự điều chỉnh với trạng thái nội bộ, số liệu thống kê, tên và hành vi, cho phép điều chỉnh ranh giới động, thích ứng ngưỡng Bayes, giám sát vận tốc và gia tốc của centroid, ước lượng mật độ dựa trên MST và cập nhật tổng hợp gia tăng. Bài viết cũng đề cập đến các khái niệm đại số tuyến tính cơ bản: vector, các phép toán vector, tích vô hướng và chuẩn Euclid, những khái niệm cần thiết để hiểu các phương pháp phân cụm.
Nguồn: Хабр — Data Mining —
bản gốc
