Construyendo flujos de trabajo con agentes usando SageMaker AI y Bedrock AgentCore
Amazon Web Services
Anthropic
Alibaba/Qwen
Esta publicación demuestra cómo combinar endpoints compatibles con OpenAI en Amazon SageMaker AI con el runtime de Amazon Bedrock AgentCore para construir sistemas multiagente. Guía el despliegue de Qwen 3.5 9B en SageMaker AI, su integración en un sistema multiagente Strands Agents junto con modelos en Amazon Bedrock, y el envío de todo el flujo de trabajo al runtime de Amazon Bedrock AgentCore. Se centra en la mecánica de integración, incluida la observabilidad a nivel de token de los endpoints de SageMaker, que Strands no proporciona por defecto.
Un desafío común al construir flujos de trabajo de agentes es combinar modelos fundacionales gestionados con tus propios modelos optimizados por coste o específicos de dominio sin reescribir el marco del agente. Esta publicación muestra cómo combinar endpoints compatibles con OpenAI en Amazon SageMaker AI con el runtime de Amazon Bedrock AgentCore y su despliegue gestionado. La arquitectura conecta tres rutas de alojamiento de modelos a través de un único contenedor de Amazon Bedrock AgentCore: un agente orquestador (Claude Haiku 4.5 en Bedrock) para la clasificación de intenciones y el enrutamiento, un agente de presupuesto (Claude Sonnet 4.6 en Bedrock) para desgloses de presupuesto, y un agente de análisis financiero (Qwen 3.5 9B en Amazon SageMaker AI) para análisis bursátil mediante llamadas a herramientas. El despliegue incluye tokens portadores que se renuevan automáticamente para sesiones de larga duración, utilizando el patrón de agentes como herramientas de Strands Agents, y desplegando mediante el bedrock-agentcore-starter-toolkit. Un desafío clave es que el runtime de Amazon Bedrock AgentCore instrumenta automáticamente los agentes con OpenTelemetry, pero los endpoints compatibles con OpenAI de SageMaker no reciben telemetría automática de tokens. La solución implica emitir manualmente tramos de chat de IA generativa que envuelven la invocación del agente de SageMaker y extraer el uso de tokens de AgentResult.metrics.accumulated_usage de Strands. Además, se debe establecer stream_options: {"include_usage": True} porque vLLM no incluye un bloque de uso en las respuestas de streaming por defecto. La publicación también cubre la configuración paso a paso, un ejemplo de salida de trazas, lecciones clave y la ampliación del patrón con modelos ajustados, pruebas A/B con componentes de inferencia y enrutamiento basado en costes.
Fuente: AWS ML blog —
original
