Tối ưu hóa các tác nhân sản xuất với khả năng quan sát của Amazon Bedrock AgentCore
Amazon/AWS
Bài viết này từ blog về học máy (ML) của AWS đề cập đến các vấn đề về hiệu suất và bộ nhớ trong các tác nhân trí tuệ nhân tạo (AI) sau khi chúng được đưa vào sản xuất. Bài viết hướng dẫn sử dụng khả năng quan sát của Amazon Bedrock AgentCore cùng với Amazon CloudWatch để xác định các điểm nghẽn (bottleneck) và rò rỉ bộ nhớ, đồng thời cung cấp các phương pháp tốt nhất để giám sát và tối ưu hóa.
Bài viết này là Phần 2 của loạt bài về gỡ rối các tác nhân AI, tập trung vào các tác nhân hoạt động đúng nhưng hiệu suất kém. Tình huống 3 đề cập đến các nút thắt cổ về hiệu suất: các triệu chứng bao gồm độ trễ tăng dần, thời gian phản hồi P95 vượt ngưỡng, nhưng tỷ lệ lỗi thấp. Để chẩn đoán, hãy truy vấn CloudWatch để tìm các lần gọi có độ trễ cao, phân tích dòng thời gian yêu cầu qua các dấu vết OpenTelemetry, và kiểm tra độ trễ truy xuất bộ nhớ (phải dưới 200 mili giây) và độ trễ gọi công cụ. Nguyên nhân gốc bao gồm thực thi công cụ chậm, tạo token quá mức và xử lý tuần tự. Các giải pháp bao gồm bộ nhớ đệm, gộp nhóm kết nối, lập chỉ mục cơ sở dữ liệu, tối ưu hóa prompt để ngắn gọn và chạy song song các lời gọi công cụ độc lập. Tình huống 4 giải quyết các vấn đề về bộ nhớ trong các phiên dài, khi mức sử dụng bộ nhớ tăng không giới hạn, dẫn đến giới hạn token và lỗi phiên. Để xác định, hãy truy vấn các phiên dài có mức sử dụng bộ nhớ cao, xem xét các mẫu trích xuất bộ nhớ và kiểm tra các lỗi trích xuất. Nguyên nhân gốc bao gồm cài đặt sai; các giải pháp bao gồm hợp nhất bộ nhớ, mẫu không gian tên và đặt thời gian hết hạn sự kiện. Bài viết kết thúc với các thực hành tốt nhất trong sản xuất: thiết bị đo lường toàn diện, cảnh báo CloudWatch, bảng điều khiển và sử dụng AgentCore Evaluators và Insights để giám sát chủ động.
Nguồn: AWS ML blog —
bản gốc
