AI 에이전트 평가하기: AWS와 Motorway의 Strands 및 AgentCore를 활용한 프로덕션 청사진
Amazon/AWS
Amazon Web Services
Anthropic
영국 온라인 자동차 마켓플레이스 Motorway는 AWS와 협력하여 AI 기반 딜러 재고 검색 에이전트를 구축했습니다. Strands Agents SDK와 Amazon Bedrock AgentCore를 결합한 평가 파이프라인을 개발하여 잘못된 결과를 8회 질의당 1건에서 50회당 1건으로 줄이고 문제 감지 시간을 몇 시간에서 몇 분으로 단축했습니다. 이 청사진에는 도구 사용, 추론 및 출력 품질을 위한 3계층 평가 프레임워크가 포함되어 있으며, 메트릭이 임계값 이하로 떨어지면 품질 게이트가 배포를 차단합니다.
Motorway는 매일 최대 2,500대의 차량에 대해 최대 8,000명의 딜러가 입찰하는 경매를 운영합니다. AWS와 협력하여 딜러가 수동 필터링 대신 자연어 쿼리로 재고를 검색할 수 있는 AI 에이전트를 구축했습니다. 이 에이전트는 89개 차량 속성에 대한 구조화된 필터링과 LanceDB 및 Amazon Titan Text Embeddings V2를 통한 벡터 유사성 검색을 결합한 8개의 도구를 제공합니다. 신뢰성을 보장하기 위해 빌드 타임 테스트(strands-agents-evals 사용)와 프로덕션 모니터링(Amazon Bedrock AgentCore Evaluations 사용)의 2단계 평가 전략을 수립했습니다. 3계층 프레임워크는 도구 사용(95% 이상 임계값), 추론(85% 이상), 출력 품질(90% 이상)을 평가합니다. 비결정성을 처리하기 위해 pass^k 메트릭을 사용합니다. 고객 대면 에이전트의 경우 연속 시도 성공이 가장 중요합니다. 이 파이프라인은 잘못된 결과를 8개 쿼리 중 1개에서 50개 중 1개로 줄였고, 문제 발견 시간을 몇 시간에서 몇 분으로 단축했습니다. 함께 제공되는 저장소에는 다른 에이전트에 적용 가능한 배포 가능 청사진이 포함되어 있습니다.
출처: AWS ML blog —
원문
