SageMaker AI और Bedrock AgentCore के साथ एजेंटिक वर्कफ़्लो बनाना
Amazon Web Services
Anthropic
Alibaba/Qwen
यह पोस्ट Amazon SageMaker AI पर OpenAI-संगत एंडपॉइंट्स को Amazon Bedrock AgentCore रनटाइम के साथ जोड़कर मल्टी-एजेंट सिस्टम बनाने का तरीका दिखाता है। यह SageMaker AI पर Qwen 3.5 9B को तैनात करने, Amazon Bedrock पर मॉडलों के साथ इसे Strands Agents मल्टी-एजेंट सिस्टम में एकीकृत करने और पूरे वर्कफ़्लो को Amazon Bedrock AgentCore रनटाइम में भेजने की प्रक्रिया बताता है। ध्यान एकीकरण यांत्रिकी पर है, जिसमें SageMaker एंडपॉइंट्स से टोकन-स्तरीय अवलोकन शामिल है, जो Strands डिफ़ॉल्ट रूप से प्रदान नहीं करता है।
एजेंटिक वर्कफ़्लो बनाने में एक आम चुनौती है, एजेंट फ्रेमवर्क को दोबारा लिखे बिना प्रबंधित फाउंडेशन मॉडल को अपने लागत-अनुकूलित या डोमेन-विशिष्ट मॉडल के साथ मिलाना। यह पोस्ट दिखाता है कि Amazon SageMaker AI पर OpenAI-संगत एंडपॉइंट को Amazon Bedrock AgentCore रनटाइम और उसकी प्रबंधित डिप्लॉयमेंट के साथ कैसे जोड़ा जाए। यह आर्किटेक्चर एक ही Amazon Bedrock AgentCore कंटेनर के माध्यम से तीन मॉडल-होस्टिंग पथों को जोड़ता है: इंटेंट वर्गीकरण और रूटिंग के लिए एक ऑर्केस्ट्रेटर एजेंट (Bedrock पर Claude Haiku 4.5), बजट ब्रेकडाउन के लिए एक बजट एजेंट (Bedrock पर Claude Sonnet 4.6), और टूल-कॉलिंग का उपयोग करके स्टॉक विश्लेषण के लिए एक वित्तीय विश्लेषण एजेंट (Amazon SageMaker AI पर Qwen 3.5 9B)। डिप्लॉयमेंट में लंबे समय तक चलने वाले सत्रों के लिए स्वतः-रीफ्रेश होने वाले बियरर टोकन, Strands Agents के एजेंट्स का टूल पैटर्न के रूप में उपयोग, और bedrock-agentcore-starter-toolkit के माध्यम से डिप्लॉय करना शामिल है। एक प्रमुख चुनौती यह है कि Amazon Bedrock AgentCore रनटाइम स्वचालित रूप से एजेंटों को OpenTelemetry के साथ इंस्ट्रूमेंट करता है, लेकिन SageMaker OpenAI-संगत एंडपॉइंट को स्वचालित टोकन टेलीमेट्री नहीं मिलती है। समाधान में SageMaker एजेंट आह्वान को लपेटते हुए मैन्युअल रूप से gen_ai.chat स्पैन उत्सर्जित करना और Strands के AgentResult.metrics.accumulated_usage से टोकन उपयोग निकालना शामिल है। इसके अतिरिक्त, stream_options: {"include_usage": True} सेट किया जाना चाहिए क्योंकि vLLM डिफ़ॉल्ट रूप से स्ट्रीमिंग प्रतिक्रियाओं में उपयोग चंक शामिल नहीं करता है। पोस्ट में चरण-दर-चरण कॉन्फ़िगरेशन, उदाहरण ट्रेस आउटपुट, मुख्य सीख, और फाइन-ट्यून किए गए मॉडल के साथ पैटर्न का विस्तार, इन्फ्रेंस घटकों के साथ ए/बी परीक्षण, और लागत-जागरूक रूटिंग भी शामिल है।
स्रोत: AWS ML blog —
मूल
