TReNDS tự động hóa phân tích nguyên nhân gốc với Amazon Bedrock
Amazon/AWS
Anthropic
Amazon Web Services
TReNDS, một trung tâm nghiên cứu hình ảnh thần kinh, đã xây dựng một hệ thống tự động sử dụng Amazon Bedrock và Strands Agents SDK để điều tra lỗi sản xuất. Hệ thống phát hiện lỗi trong nhật ký CloudWatch, lấy ngữ cảnh và mã nguồn, đồng thời gửi phân tích nguyên nhân gốc cho nhóm qua SNS, giảm thời gian điều tra từ 15–30 phút xuống dưới 60 giây.
TReNDS (Center for Translational Research in Neuroimaging and Data Science) đã sử dụng AWS (Amazon Web Services) từ năm 2019, với các ứng dụng chạy trên Amazon EKS và log được thu thập trong CloudWatch thông qua FluentBit. Họ đã xây dựng một kiến trúc tự động hóa việc phân tích nguyên nhân gốc rễ (root-cause analysis): các bộ lọc đăng ký (subscription filter) của CloudWatch sẽ kích hoạt một hàm Lambda khi phát hiện các mẫu lỗi (error pattern), hàm Lambda này chạy một Strands Agent được vận hành bởi Amazon Bedrock (sử dụng Anthropic Claude Sonnet làm mô hình chính), truy xuất thêm ngữ cảnh log và mã nguồn từ GitHub, suy luận về lỗi xảy ra, rồi công bố kết quả phân tích có cấu trúc lên SNS để gửi qua email và Slack.
Hệ thống này đã giảm thời gian điều tra từ 15-30 phút xuống còn dưới 60 giây, với chi phí suy luận (inference) trên Bedrock ở mức tối thiểu (chỉ 2-3 vòng sử dụng công cụ cho mỗi lỗi). Họ đã thử nghiệm với Claude Sonnet, Haiku, Opus, và Amazon Nova Pro/Lite, và cuối cùng chọn Sonnet vì độ chính xác cao. Việc khử trùng lặp (deduplication) thông qua DynamoDB giúp ngăn chặn việc phân tích lặp lại đối với các lỗi tương tự.
Nguồn: AWS ML blog —
bản gốc
