Evaluating AI Agents: A Production Template with Strands and AgentCore from AWS and Motorway
Amazon/AWS
Amazon Web Services
Anthropic
Motorway, a British online car marketplace, together with AWS, developed an AI agent evaluation pipeline for searching cars from dealers. The solution reduced incorrect results from 1 in 8 to 1 in 50 queries and cut problem identification time from several hours to a few minutes. At its core is a two-phase evaluation strategy using Strands Agents SDK and Amazon Bedrock AgentCore.
Motorway(英国のオンライン車両市場。毎日最大8000のディーラーが2500台の車両を競りにかける)は、AWS PACEと協力して、ディーラーの在庫から車両を検索するAIエージェントを構築しました。このエージェントは8つのツールを使用し、89の属性による構造化フィルタリングと、LanceDBおよびAmazon Titan Text Embeddings V2をベースとしたベクトル検索を組み合わせています。エージェントの信頼性を確保するため、MotorwayとAWSは評価パイプラインを構築し、誤った結果の割合をクエリ8件中1件から50件中1件に低減し、問題発見にかかる時間を数時間から数分に短縮しました。パイプラインには2フェーズの戦略が含まれています:strands-agents-evalsライブラリを用いたビルド時のテストと、Amazon Bedrock AgentCore Evaluationsによる本番環境でのモニタリングです。評価は3つのレベルで行われます:ツール使用(閾値>95%)、推論ロジック(>85%)、出力品質(>90%)。LLMの非決定性に対処するため、pass^kメトリクス(k回連続の試行を成功させる確率)が使用されます。パイプラインは品質ゲートを備えた5段階のデプロイメントを含みます。付属のリポジトリでは、他のエージェントに適応可能なデプロイ可能なテンプレートが提供されています。
出典: AWS ML blog —
原文
