AgentenHardware & Inferenz 🇺🇸 14.08.2026 19:09

Agentische Workflows mit SageMaker AI und Bedrock AgentCore erstellen

Amazon Web ServicesAmazon Web Services AnthropicAnthropic Alibaba/QwenAlibaba/Qwen
Dieser Beitrag zeigt, wie man OpenAI-kompatible Endpunkte auf Amazon SageMaker AI mit der Amazon Bedrock AgentCore-Laufzeit kombiniert, um Multi-Agenten-Systeme zu bauen. Er führt durch die Bereitstellung von Qwen 3.5 9B auf SageMaker AI, die Integration in ein Strands-Agents-Multi-Agenten-System zusammen mit Modellen auf Amazon Bedrock und die Auslieferung des gesamten Workflows an die Amazon Bedrock AgentCore-Laufzeit. Der Schwerpunkt liegt auf Integrationsmechanismen, einschließlich Token-Ebene-Beobachtbarkeit von SageMaker-Endpunkten, die Strands standardmäßig nicht bietet.
Eine häufige Herausforderung beim Aufbau agentischer Workflows besteht darin, verwaltete Foundation-Modelle mit eigenen kostenoptimierten oder domainspezifischen Modellen zu kombinieren, ohne das Agent-Framework neu zu schreiben. Dieser Beitrag zeigt, wie man OpenAI-kompatible Endpunkte auf Amazon SageMaker AI mit Amazon Bedrock AgentCore Runtime und deren verwaltetem Deployment kombiniert. Die Architektur verbindet drei Modell-Hosting-Pfade über einen einzigen Amazon Bedrock AgentCore Container: einen Orchestrator-Agenten (Claude Haiku 4.5 auf Bedrock) für Intent-Klassifikation und Routing, einen Budget-Agenten (Claude Sonnet 4.6 auf Bedrock) für Budgetaufschlüsselungen und einen Finanzanalyse-Agenten (Qwen 3.5 9B auf Amazon SageMaker AI) für Aktienanalysen mittels Tool-Calling. Das Deployment umfasst automatisch aktualisierende Bearer-Tokens für langlebige Sitzungen, die Nutzung des Musters von Strands Agents' Agents as Tools sowie die Bereitstellung über das bedrock-agentcore-starter-toolkit. Eine zentrale Herausforderung besteht darin, dass Amazon Bedrock AgentCore Runtime Agenten automatisch mit OpenTelemetry instrumentiert, aber SageMaker OpenAI-kompatible Endpunkte keine automatische Token-Telemetrie erhalten. Die Lösung besteht darin, manuell gen_ai.chat-Spans zu emittieren, die die SageMaker-Agentenaufrufe umschließen, und die Token-Nutzung aus Strands' AgentResult.metrics.accumulated_usage zu extrahieren. Zusätzlich muss stream_options: {"include_usage": True} gesetzt werden, da vLLM standardmäßig keinen Usage-Chunk in Streaming-Antworten enthält. Der Beitrag behandelt außerdem die Schritt-für-Schritt-Konfiguration, Beispiel-Trace-Ausgaben, wichtige Erkenntnisse und die Erweiterung des Musters mit feinabgestimmten Modellen, A/B-Tests mit Inferenzkomponenten sowie kostenbewusstes Routing.
Quelle: AWS ML blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten