и ее управляемым развертыванием. Архитектура объединяет три пути размещения моделей через единый контейнер Amazon Bedrock AgentCore: агент-оркестратор (Claude Haiku 4.5 от Bedrock) для классификации намерений и маршрутизации, агент по бюджету (Claude Sonnet 4.6 от Bedrock) для детализации расходов и агент по финансовому анализу (Qwen 3.5 9B на Amazon SageMaker AI) для анализа акций с использованием вызова инструментов. Развертывание включает автоматически обновляемые токены носителя для долгосрочных сессий, использует паттерн «агенты как инструменты» от Strands Agents и разворачивается через bedrock-agentcore-starter-toolkit. Ключевая проблема заключается в том, что среда выполнения Amazon Bedrock AgentCore автоматически инструментирует агенты с OpenTelemetry, но OpenAI-совместимые конечные точки SageMaker не получают автоматическую телеметрию по токенам. Решение предусматривает ручную генерацию spans gen_ai.chat, оборачивающих вызов агента в SageMaker, и извлечение использования токенов из Strands' AgentResult.metrics.accumulated_usage. Кроме того, необходимо задать stream_options: {"include_usage": True}, поскольку vLLM по умолчанию не включает фрагмент с использованием токенов в потоковые ответы. В материале также рассматривается пошаговая конфигурация, пример вывода трассировки, основные выводы и расширение паттерна с помощью дообученных моделей, A/B-тестирование с компонентами вывода и маршрутизация с учетом стоимости.