Tác tửKinh doanh & Thị trường 🇺🇸 23.07.2026 23:49

Đánh giá AI Agents: Một blueprint sản xuất với Strands và AgentCore từ AWS và Motorway

Amazon/AWSAmazon/AWS Amazon Web ServicesAmazon Web Services AnthropicAnthropic
Motorway, một chợ ô tô trực tuyến tại Anh, đã hợp tác với AWS để xây dựng một agent tìm kiếm đại lý xe hơi hỗ trợ AI. Họ đã phát triển một pipeline đánh giá kết hợp Strands Agents SDK và Amazon Bedrock AgentCore, giảm kết quả không chính xác từ 1 trên 8 truy vấn xuống còn 1 trên 50 và cắt giảm thời gian phát hiện vấn đề từ nhiều giờ xuống còn vài phút. Blueprint bao gồm một khung đánh giá ba lớp cho việc sử dụng công cụ, suy luận và chất lượng đầu ra, với các cổng chất lượng chặn triển khai khi các chỉ số giảm dưới ngưỡng.
Motorway vận hành một cuộc đấu giá hàng ngày với tối đa 8.000 đại lý tham gia đấu giá trên tối đa 2.500 xe. Làm việc với AWS, họ đã xây dựng một tác nhân trí tuệ nhân tạo cho phép các đại lý tìm kiếm hàng tồn kho bằng các truy vấn ngôn ngữ tự nhiên thay vì lọc thủ công. Tác nhân này cung cấp tám công cụ kết hợp lọc có cấu trúc qua 89 thuộc tính xe với tìm kiếm tương tự vector qua LanceDB và Amazon Titan Text Embeddings V2. Để đảm bảo độ tin cậy, họ đã tạo ra một chiến lược đánh giá hai giai đoạn: kiểm thử trong quá trình xây dựng với strands-agents-evals và giám sát sản xuất với Amazon Bedrock AgentCore Evaluations. Một khung ba lớp đánh giá việc sử dụng công cụ (ngưỡng trên 95%), lý luận (trên 85%) và chất lượng đầu ra (trên 90%). Một chỉ số pass^k xử lý tính không xác định: đối với các tác nhân hướng tới khách hàng, thành công trong các thử nghiệm liên tiếp là quan trọng nhất. Quy trình đã giảm kết quả không chính xác từ 1 trong 8 truy vấn xuống còn 1 trong 50 và giảm thời gian phát hiện vấn đề từ hàng giờ xuống còn vài phút. Một kho lưu trữ đi kèm cung cấp một bản thiết kế có thể triển khai, có thể thích ứng cho các tác nhân khác.
Nguồn: AWS ML blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới