评估AI代理:AWS和Motorway提出的Strands与AgentCore生产模板
Amazon/AWS
Amazon Web Services
Anthropic
英国在线汽车市场Motorway与AWS合作,开发了一个用于从经销商搜索汽车的AI代理评估流水线。该解决方案将错误结果从每8次查询1次减少到每50次查询1次,并将问题识别时间从几小时缩短到几分钟。其核心是一个两阶段评估策略,使用Strands Agents SDK和Amazon Bedrock AgentCore。
Motorway,这家英国在线汽车交易市场每天有最多8000家经销商竞拍2500辆汽车,现与AWS PACE合作推出了一个AI智能代理(AI agent),用于在经销商的库存中搜索车辆。该代理使用了八种工具,将基于89个属性的结构化筛选与基于LanceDB和Amazon Titan Text Embeddings V2的向量搜索相结合。为确保代理的可靠性,Motorway与AWS共同构建了一个评估管道,将错误结果的比例从每8次查询中有1次降低到每50次中有1次,并将问题发现时间从几小时缩短到几分钟。该管道采用两阶段策略:通过strands-agents-evals库在构建时进行测试,以及通过Amazon Bedrock AgentCore Evaluations在生产环境中进行监控。评估分为三个层面:工具使用(阈值>95%)、推理逻辑(>85%)和输出质量(>90%)。为应对大语言模型(LLM)的非确定性,采用了pass^k指标——即连续k次尝试成功的概率。该管道包含五个部署阶段,并设有质量门控。配套的代码仓库中提供了一个可部署的模板,适用于其他智能代理。
来源: AWS ML blog —
原文
