SageMaker AI 및 Bedrock AgentCore로 에이전트 워크플로 구축
Amazon Web Services
Anthropic
Alibaba/Qwen
이 게시물은 Amazon SageMaker AI의 OpenAI 호환 엔드포인트와 Amazon Bedrock AgentCore 런타임을 결합하여 멀티 에이전트 시스템을 구축하는 방법을 보여준다. SageMaker AI에 Qwen 3.5 9B를 배포하고, Amazon Bedrock의 모델과 함께 Strands Agents 멀티 에이전트 시스템에 통합하고, 전체 워크플로우를 Amazon Bedrock AgentCore 런타임으로 전달하는 과정을 안내한다. 초점은 Strands가 기본적으로 제공하지 않는 SageMaker 엔드포인트의 토큰 수준 관측 가능성을 포함한 통합 메커니즘에 있다.
에이전틱 워크플로우를 구축할 때 흔히 겪는 어려움은 에이전트 프레임워크를 다시 작성하지 않고 관리형 파운데이션 모델과 자체 비용 최적화 모델 또는 도메인 특화 모델을 혼합하는 것입니다. 이 게시물에서는 Amazon SageMaker AI의 OpenAI 호환 엔드포인트와 Amazon Bedrock AgentCore 런타임 및 그 관리형 배포를 결합하는 방법을 보여줍니다. 이 아키텍처는 단일 Amazon Bedrock AgentCore 컨테이너를 통해 세 가지 모델 호스팅 경로를 연결합니다: 의도 분류 및 라우팅을 위한 오케스트레이터 에이전트(Bedrock의 Claude Haiku 4.5), 예산 분류를 위한 예산 에이전트(Bedrock의 Claude Sonnet 4.6), 그리고 도구 호출을 사용한 주식 분석을 위한 재무 분석 에이전트(SageMaker AI의 Qwen 3.5 9B). 배포에는 장기 실행 세션을 위한 자동 갱신 베어러 토큰이 포함되며, Strands Agents의 에이전트 도구 패턴을 사용하고 bedrock-agentcore-starter-toolkit을 통해 배포합니다. 주요 과제는 Amazon Bedrock AgentCore 런타임이 에이전트를 OpenTelemetry로 자동 계측하지만, SageMaker OpenAI 호환 엔드포인트는 자동 토큰 텔레메트리를 얻지 못한다는 점입니다. 해결책은 SageMaker 에이전트 호출을 래핑하는 gen_ai.chat 스팬을 수동으로 생성하고 Strands의 AgentResult.metrics.accumulated_usage에서 토큰 사용량을 추출하는 것입니다. 또한, vLLM이 스트리밍 응답에 기본적으로 사용량 청크를 포함하지 않기 때문에 stream_options: {"include_usage": true}를 설정해야 합니다. 이 게시물은 또한 단계별 구성, 예제 트레이스 출력, 주요 학습 사항, 그리고 파인튜닝된 모델로 패턴 확장, 추론 컴포넌트를 사용한 A/B 테스트, 비용 인지 라우팅에 대해 다룹니다.
출처: AWS ML blog —
원문
