智能体硬件与推理 🇺🇸 14.08.2026 19:09

使用SageMaker AI和Bedrock AgentCore构建代理工作流

Amazon Web ServicesAmazon Web Services AnthropicAnthropic Alibaba/QwenAlibaba/Qwen
这篇文章演示了如何将Amazon SageMaker AI上的OpenAI兼容端点与Amazon Bedrock AgentCore运行时结合,以构建多代理系统。它逐步介绍了在SageMaker AI上部署Qwen 3.5 9B,将其集成到Strands Agents多代理系统中,与Amazon Bedrock上的模型一起,并将整个工作流发送到Amazon Bedrock AgentCore运行时。重点在于集成机制,包括来自SageMaker端点的令牌级可观察性,而Strands默认不提供这一点。
构建智能体工作流时,一个常见挑战是如何在无需重写智能体框架的情况下,混合使用托管基础模型和您自己的成本优化或领域特定模型。本文展示了如何将Amazon SageMaker AI上的OpenAI兼容端点与Amazon Bedrock AgentCore运行时及其托管部署相结合。该架构通过单个Amazon Bedrock AgentCore容器连接三条模型托管路径:一个编排智能体(Bedrock上的Claude Haiku 4.5)用于意图分类和路由,一个预算智能体(Bedrock上的Claude Sonnet 4.6)用于预算分解,以及一个财务分析智能体(SageMaker AI上的Qwen 3.5 9B)使用工具调用进行股票分析。该部署包括为长时间运行的会话自动刷新Bearer令牌,采用Strands Agents的智能体即工具模式,并通过bedrock-agentcore-starter-toolkit进行部署。一个关键挑战是,Amazon Bedrock AgentCore运行时自动为智能体添加OpenTelemetry插桩,但SageMaker OpenAI兼容端点不会自动获得令牌遥测。解决方案涉及手动生成gen_ai.chat span,包裹SageMaker智能体调用,并从Strands的AgentResult.metrics.accumulated_usage中提取令牌使用情况。此外,必须设置stream_options: {"include_usage": True},因为vLLM在默认情况下不会在流式响应中包含使用情况块。本文还涵盖了逐步配置、示例追踪输出、关键经验教训,以及如何将此模式扩展到微调模型、使用推理组件进行A/B测试,以及成本感知路由。
来源: AWS ML blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻