评估AI代理:AWS和Motorway基于Strands与AgentCore的生产蓝图
Amazon/AWS
Amazon Web Services
Anthropic
英国在线汽车市场Motorway与AWS合作构建了AI驱动的经销商库存搜索代理。他们开发了一套结合Strands Agents SDK和Amazon Bedrock AgentCore的评估流水线,将错误结果从每8次查询1次降至每50次1次,并将问题检测时间从数小时缩短至数分钟。该蓝图包括一个三层评估框架,涵盖工具使用、推理和输出质量,并设有质量门控,当指标低于阈值时阻止部署。
Motorway运营着一项每日拍卖活动,多达8000名经销商竞拍最多2500辆汽车。通过与AWS合作,他们构建了一个AI智能体,使经销商能够使用自然语言查询搜索库存,而无需手动筛选。该智能体暴露了八个工具,这些工具结合了跨89个车辆属性的结构化筛选,以及通过LanceDB和Amazon Titan文本嵌入V2进行的向量相似性搜索。为确保可靠性,他们制定了两阶段评估策略:构建时测试(使用strands-agents-evals)和生产监控(使用Amazon Bedrock AgentCore评估)。一个三层框架评估工具使用(超过95%阈值)、推理(超过85%)和输出质量(超过90%)。一个pass^k指标处理非确定性:对于面向客户的智能体,连续试验成功最为重要。该流水线将错误结果从每8次查询中1次减少到每50次查询中1次,并将问题检测时间从数小时缩短到数分钟。一个配套仓库提供了一个可部署的蓝图,适用于其他智能体。
来源: AWS ML blog —
原文
