Agenttityönkulkujen rakentaminen SageMaker AI:lla ja Bedrock AgentCorella
Amazon Web Services
Anthropic
Alibaba/Qwen
Tämä kirjoitus osoittaa, miten yhdistetään OpenAI-yhteensopivia päätepisteitä Amazon SageMaker AI:lla Amazon Bedrock AgentCoren ajonaikaan moniagenttijärjestelmien rakentamiseksi. Siinä käydään läpi Qwen 3.5 9B:n käyttöönotto SageMaker AI:lla, sen integrointi Strands Agents -moniagenttijärjestelmään yhdessä Amazon Bedrockin mallien kanssa ja koko työnkulun siirtäminen Amazon Bedrock AgentCoren ajonaikaan. Painopiste on integroinnin mekaniikassa, mukaan lukien token-tason näkyvyys SageMaker-päätepisteistä, jota Strands ei oletuksena tarjoa.
Agentti-pohjaisten työnkulkujen rakentamisessa yleinen haaste on hallittujen perusmallien yhdistäminen omiin kustannusoptimoituihin tai toimialakohtaisiin malleihin ilman, että agenttikehystä joudutaan kirjoittamaan uusiksi. Tämä julkaisu näyttää, miten OpenAI-yhteensopivat päätepisteet Amazon SageMaker AI:ssa yhdistetään Amazon Bedrock AgentCore -ajonaikaan ja sen hallinnoituun käyttöönottoon. Arkkitehtuuri yhdistää kolme mallin isännöintipolkua yhden Amazon Bedrock AgentCore -kontin kautta: orkestraattoriagentin (Claude Haiku 4.5 Bedrockissa) intentioiden luokitteluun ja reititykseen, budjettiagentin (Claude Sonnet 4.6 Bedrockissa) budjettierittelyihin sekä talousanalyysiagentin (Qwen 3.5 9B Amazon SageMaker AI:ssa) osakeanalyysiin työkalujen kutsumisen avulla. Käyttöönotto sisältää automaattisesti päivittyvät bearer-tokenit pitkäkestoisiin istuntoihin, käyttää Strands Agents -agenttien työkaluina -kuviota ja ottaa käyttöön bedrock-agentcore-starter-toolkitin avulla. Keskeinen haaste on, että Amazon Bedrock AgentCore -ajonaika instrumentoi agentit automaattisesti OpenTelemetryllä, mutta SageMakerin OpenAI-yhteensopivat päätepisteet eivät saa automaattista token-telemetriaa. Ratkaisuna on manuaalisesti lähettää gen_ai.chat-spanit, jotka kääriyvät SageMaker-agentin kutsun ympärille, ja poimia tokenien käyttö Strandsin AgentResult.metrics.accumulated_usage-kentästä. Lisäksi on asetettava stream_options: {"include_usage": true}, koska vLLM ei sisällä käyttötietoja suoratoistovastauksissa oletusarvoisesti. Julkaisu käsittelee myös vaiheittaisen määrityksen, esimerkkitrace-tulosteen, keskeiset opit sekä kuvion laajentamisen hienosäädetyillä malleilla, A/B-testauksen päätelmäkomponenteilla ja kustannustietoisen reitityksen.
Lähde: AWS ML blog —
Alkuperäinen
