Microsoft onthult AI-agent LLM-routeringsarchitectuur op AKS, met kostenbesparingen tot 85%
Microsoft
OpenAI
RouteLLM
Microsoft heeft een referentiearchitectuur gepubliceerd voor het routeren van agentverkeer op Azure Kubernetes Service (AKS), waarbij RouteLLM voor semantische routering, agentgateway voor governance en de Kubernetes Gateway API Inference Extension voor GPU-bewuste belastingverdeling worden gecombineerd. Het ontwerp is gericht op agentische workloads, waarbij veel LLM-aanroepen geen frontier-modellen vereisen, wat mogelijk tot 85% kostenbesparingen kan leiden. De besparingen hangen echter af van de kalibratie van modelparen en de volwassenheid van de componenten.
Microsoft heeft een referentiearchitectuur gepubliceerd voor het routeren van agentverkeer op Azure Kubernetes Service (AKS), waarbij het probleem in drie kernkeuzes wordt opgedeeld: welk model reageert op een oproep, hoe de oproep wordt beheerd en welke GPU-replica deze afhandelt. Het ontwerp combineert de Kubernetes Gateway API Inference Extension voor taakverdeling, agentgateway als AI-proxy en RouteLLM voor semantische routing, allemaal verbonden met een OpenAI-compatibel eindpunt. Dit is afgestemd op agentische workloads in plaats van eenvoudige chat, omdat één enkele agenttaak honderden LLM-aanroepen kan veroorzaken in een planning-actie-observerende lus, waarvan de meeste (het invullen van toolargumenten, ja/nee-beslissingen, samenvattingen) geen frontier-model vereisen. RouteLLM inspecteert de prompt en voorspelt of een goedkoper model de kwaliteit van een sterker model kan evenaren, met behulp van een matrixfactorisatierouter getraind op gegevens over menselijke voorkeuren. Agentgateway, een open-source proxy die compatibel is met OpenAI, beheert authenticatie, snelheidslimieten per agent, kostentracking en beveiligingsmaatregelen zonder de inhoud van prompts te inspecteren. De Endpoint Picker van de Gateway API Inference Extension controleert de realtime GPU-status, inclusief vLLM's KV-cachegebruik en wachtrijdiepte, om te bepalen welke replica van het geselecteerde model het verzoek afhandelt. Voor self-hosted paden roept agentgateway Endpoint Picker aan via ext-proc, waarbij een aparte Gateway API-gateway wordt omzeild. KAITO biedt GPU-knooppuntpools op aanvraag en draait vLLM, met statistieken zoals vllm:num_requests_waiting en vllm:kv_cache_usage_perc. Het sterke modelpad gaat via de AI-backend van agentgateway naar Azure OpenAI, terwijl het zwakke modelpad via een service-backend naar door KAITO aangeboden pods wordt gerouteerd. Azure-beheerde Prometheus en Grafana verzamelen routerings-, kosten- en GPU-statistieken voor een uniform beeld. Een belangrijk getal is de upgrade-drempel van RouteLLM: bij geteste modelparen behaalde de mf-router ongeveer 95% van de kwaliteit van GPT-4 op MT-Bench terwijl slechts ongeveer 26% van de oproepen naar GPT-4 werd gestuurd, wat tot 85% kostenbesparing oplevert. Microsoft waarschuwt dat dit cijfer niet automatisch is en afhangt van het modelpaar dat is gebruikt om RouteLLM te trainen; gebruikers moeten drempels kalibreren op basis van daadwerkelijk verkeer. Prompt-caching compliceert tokengerelateerde kosten, omdat cache-hits kortingen krijgen en het wisselen van modellen caches aan beide kanten afkoelt. Het artikel waarschuwt dat componenten jong zijn; velden veranderen tussen versies - de Inference Extension is hernoemd en CRD's zijn hergestructureerd vóór v1. Alles is end-to-end geverifieerd in medio 2026 op AKS met Inference Extension v1.0.0 en agentgateway v1.3.1. Teams kunnen de architectuur in fasen adopteren: voor beheerde modellen met weinig agents is agentgateway-governance voldoende; voor self-hosted single-model zijn KAITO en Inference Extension voldoende zonder semantische routing; RouteLLM is de moeite waard wanneer er een duidelijk prijsverschil is tussen sterke en zwakke modellen en aanzienlijk eenvoudig verkeer, wat van toepassing is op bijna alle lopende agents.
Bron: InfoQ 中国 —
origineel
