माइक्रोसॉफ्ट ने AKS पर AI एजेंट LLM रूटिंग आर्किटेक्चर पेश किया, लागत में 85% तक की कटौती
Microsoft
OpenAI
RouteLLM
माइक्रोसॉफ्ट ने Azure Kubernetes Service (AKS) पर एजेंट ट्रैफ़िक रूटिंग के लिए एक संदर्भ आर्किटेक्चर प्रकाशित किया है, जो सिमेंटिक रूटिंग के लिए RouteLLM, गवर्नेंस के लिए agentgateway, और GPU-जागरूक लोड बैलेंसिंग के लिए Kubernetes Gateway API Inference Extension को जोड़ता है। यह डिज़ाइन एजेंटिक वर्कलोड्स को लक्षित करता है, जहां कई LLM कॉलों को फ्रंटियर मॉडल की आवश्यकता नहीं होती है, जिससे लागत में 85% तक की बचत हो सकती है। हालांकि, बचत मॉडल जोड़ी कैलिब्रेशन और घटकों की परिपक्वता पर निर्भर करती है।
माइक्रोसॉफ्ट ने Azure Kubernetes Service (AKS) पर एजेंट ट्रैफ़िक को रूट करने के लिए एक संदर्भ आर्किटेक्चर प्रकाशित किया है, जिसमें समस्या को तीन प्रमुख विकल्पों में विभाजित किया गया है: कौन सा मॉडल कॉल का जवाब देता है, कॉल कैसे प्रबंधित की जाती है, और कौन सा GPU रेप्लिका इसे संभालता है। यह डिज़ाइन लोड संतुलन के लिए Kubernetes Gateway API Inference Extension, AI प्रॉक्सी के रूप में agentgateway, और RouteLLM को सिमेंटिक रूटिंग के लिए जोड़ता है, सभी एक OpenAI-संगत एंडपॉइंट से जुड़े हैं। यह केवल चैट के बजाय एजेंटिक वर्कलोड के लिए तैयार है, क्योंकि एक एजेंट कार्य प्लानिंग-एक्टिंग-ऑब्ज़र्विंग लूप में सैकड़ों LLM कॉल ट्रिगर कर सकता है, जिनमें से अधिकांश (टूल तर्क भरना, हाँ/नहीं निर्णय, सारांश) के लिए फ्रंटियर मॉडल की आवश्यकता नहीं होती है। RouteLLM प्रॉम्प्ट का निरीक्षण करता है और भविष्यवाणी करता है कि क्या एक सस्ता मॉडल मजबूत मॉडल की गुणवत्ता से मेल खा सकता है, मानव पसंद डेटा पर प्रशिक्षित मैट्रिक्स फैक्टराइजेशन राउटर का उपयोग करते हुए। Agentgateway, एक ओपन-सोर्स प्रॉक्सी जो OpenAI के साथ संगत है, प्रॉम्प्ट सामग्री का निरीक्षण किए बिना प्रमाणीकरण, प्रति-एजेंट दर सीमा, लागत ट्रैकिंग और सुरक्षा उपायों (guardrails) का प्रबंधन करता है। Gateway API Inference Extension का Endpoint Picker वास्तविक समय की GPU स्थिति की जाँच करता है, जिसमें vLLM का KV कैश उपयोग और कतार की गहराई शामिल है, यह तय करने के लिए कि चयनित मॉडल का कौन सा रेप्लिका अनुरोध संभालता है। सेल्फ-होस्टेड पथों के लिए, agentgateway ext-proc के माध्यम से Endpoint Picker को कॉल करता है, एक अलग Gateway API गेटवे को दरकिनार करते हुए। KAITO मांग पर GPU नोड पूल प्रदान करता है और vLLM चलाता है, vllm:num_requests_waiting और vllm:kv_cache_usage_perc जैसे मेट्रिक्स को उजागर करता है। मजबूत मॉडल पथ agentgateway के AI बैकएंड के माध्यम से Azure OpenAI तक जाता है, जबकि कमजोर मॉडल पथ सेवा बैकएंड के माध्यम से KAITO-सेवित पॉड्स तक रूट करता है। Azure-प्रबंधित Prometheus और Grafana रूटिंग, लागत और GPU मेट्रिक्स को एकीकृत दृश्य के लिए एकत्रित करते हैं। एक महत्वपूर्ण संख्या RouteLLM का अपग्रेड थ्रेशोल्ड है: परीक्षण किए गए मॉडल जोड़ों पर, mf राउटर ने MT-Bench पर GPT-4 की गुणवत्ता का लगभग 95% हासिल किया जबकि केवल लगभग 26% कॉल GPT-4 को भेजे, जिससे लागत में 85% तक की बचत हुई। Microsoft चेतावनी देता है कि यह आंकड़ा स्वचालित नहीं है और यह RouteLLM प्रशिक्षण के लिए उपयोग किए गए मॉडल जोड़े पर निर्भर करता है; उपयोगकर्ताओं को वास्तविक ट्रैफ़िक के आधार पर थ्रेशोल्ड को कैलिब्रेट करना चाहिए। प्रॉम्प्ट कैशिंग टोकन लागत को जटिल बनाती है, क्योंकि कैश हिट्स पर छूट मिलती है, और मॉडल स्विच करने से दोनों तरफ कैश ठंडे हो जाते हैं। लेख में सावधानी बरती गई है कि घटक युवा हैं; संस्करणों के बीच फ़ील्ड बदलते हैं—वी1 से पहले Inference Extension का नाम बदला और CRDs का पुनर्गठन किया गया। सभी को मध्य-2026 में AKS पर Inference Extension v1.0.0 और agentgateway v1.3.1 के साथ एंड-टू-एंड सत्यापित किया गया था। टीमें चरणों में वास्तुकला को अपना सकती हैं: कुछ एजेंटों के साथ प्रबंधित मॉडल के लिए, agentgateway शासन पर्याप्त है; सेल्फ-होस्टेड एकल मॉडल के लिए, सिमेंटिक रूटिंग के बिना KAITO और Inference Extension पर्याप्त हैं; RouteLLM तब मूल्यवान है जब मजबूत और कमजोर मॉडल के बीच स्पष्ट मूल्य अंतर हो और काफी सरल ट्रैफ़िक हो, जो लगभग सभी लूपिंग एजेंटों पर लागू होता है।
स्रोत: InfoQ 中国 —
मूल
