AIエージェントの評価:AWSとMotorwayによるStrandsおよびAgentCoreを用いたプロダクション設計図
Amazon/AWS
Amazon Web Services
Anthropic
英国のオンライン中古車市場Motorwayは、AWSと協力してAI搭載のディーラー在庫検索エージェントを構築しました。Strands Agents SDKとAmazon Bedrock AgentCoreを組み合わせた評価パイプラインを開発し、不正解のクエリを8回に1回から50回に1回に減少させ、問題発見時間を数時間から数分に短縮しました。この設計図には、ツール使用、推論、出力品質のための3層評価フレームワークが含まれており、メトリクスがしきい値を下回ると品質ゲートがデプロイをブロックします。
Motorway社は、最大8,000の販売業者が最大2,500台の車両に入札する日次オークションを運営しています。AWSと協力し、手動フィルタリングの代わりに自然言語クエリで在庫を検索できるAIエージェントを構築しました。このエージェントは、89の車両属性を対象とした構造化フィルタリングと、LanceDBおよびAmazon Titan Text Embeddings V2を用いたベクトル類似度検索を組み合わせた8つのツールを提供します。信頼性を確保するため、ビルド時のテストにはStrands-Agents-Evals、本番監視にはAmazon Bedrock AgentCore Evaluationsを使用する2段階評価戦略を採用しました。3層のフレームワークで、ツール使用率(閾値95%超)、推論(同85%超)、出力品質(同90%超)を評価します。非決定論性に対処するためpass^kメトリクスを導入し、カスタマー向けエージェントでは連続試行の成功が重要です。このパイプラインにより、誤った結果が8問中1問から50問中1問に減少し、問題検出時間が数時間から数分に短縮されました。付属のリポジトリでは、他のエージェントにも適用可能な展開可能な設計図を提供しています。
出典: AWS ML blog —
原文
