Microsoft stellt LLM-Routing-Architektur für KI-Agenten auf AKS vor und senkt Kosten um bis zu 85 Prozent
Microsoft
OpenAI
RouteLLM
Microsoft hat eine Referenzarchitektur für das Routing von Agenten-Traffic auf Azure Kubernetes Service (AKS) veröffentlicht, die RouteLLM für semantisches Routing, agentgateway für Governance und die Kubernetes Gateway API Inference Extension für GPU-bewusstes Lastenausgleich kombiniert. Das Design zielt auf agentische Workloads ab, bei denen viele LLM-Aufrufe keine Spitzenmodelle erfordern, wodurch möglicherweise bis zu 85 Prozent der Kosten eingespart werden können. Die Einsparungen hängen jedoch von der Kalibrierung der Modellpaare und der Reife der Komponenten ab.
Microsoft hat eine Referenzarchitektur für das Routing von Agent-Traffic auf Azure Kubernetes Service (AKS) veröffentlicht und das Problem in drei zentrale Entscheidungen unterteilt: welches Modell auf einen Aufruf antwortet, wie der Aufruf verwaltet wird und welche GPU-Replik ihn verarbeitet. Das Design kombiniert die Kubernetes Gateway API Inference Extension für das Lastverteilen, agentgateway als KI-Proxy und RouteLLM für semantisches Routing, die alle mit einem OpenAI-kompatiblen Endpunkt verbunden sind. Dies ist auf agentische Workloads zugeschnitten und nicht auf einfachen Chat, da eine einzelne Agentenaufgabe Hunderte von LLM-Aufrufen in einer Planungs-Aktions-Beobachtungs-Schleife auslösen kann, von denen die meisten (das Ausfüllen von Tool-Argumenten, Ja/Nein-Entscheidungen, Zusammenfassungen) kein Frontier-Modell erfordern. RouteLLM untersucht den Prompt und sagt voraus, ob ein günstigeres Modell die Qualität eines stärkeren Modells erreichen kann, wobei ein Matrixfaktorisierungs-Router verwendet wird, der auf menschlichen Präferenzdaten trainiert wurde. Agentgateway, ein Open-Source-Proxy, der mit OpenAI kompatibel ist, verwaltet Authentifizierung, Pro-Agent-Ratenlimits, Kostenverfolgung und Schutzmechanismen, ohne den Prompt-Inhalt zu inspizieren. Der Endpoint Picker der Gateway API Inference Extension prüft den Echtzeit-GPU-Status, einschließlich der KV-Cache-Nutzung und Warteschlangentiefe von vLLM, um zu entscheiden, welche Replik des ausgewählten Modells die Anfrage verarbeitet. Für selbst gehostete Pfade ruft agentgateway den Endpoint Picker über ext-proc auf und umgeht dabei ein separates Gateway-API-Gateway. KAITO stellt bei Bedarf GPU-Knotenpools bereit und führt vLLM aus, wobei Metriken wie vllm:num_requests_waiting und vllm:kv_cache_usage_perc verfügbar gemacht werden. Der Pfad für starke Modelle führt über das KI-Backend von agentgateway zu Azure OpenAI, während der Pfad für schwache Modelle über ein Service-Backend zu von KAITO bereitgestellten Pods führt. Azure Managed Prometheus und Grafana sammeln Routing-, Kosten- und GPU-Metriken für eine einheitliche Ansicht. Eine wichtige Zahl ist die Upgrade-Schwelle von RouteLLM: Bei getesteten Modellpaaren erreichte der MF-Router etwa 95 % der Qualität von GPT-4 auf MT-Bench, während nur etwa 26 % der Aufrufe an GPT-4 gesendet wurden, was Kostenersparnisse von bis zu 85 % ermöglicht. Microsoft warnt, dass diese Zahl nicht automatisch erreicht wird und von dem Modellpaar abhängt, das für das Training von RouteLLM verwendet wurde; Benutzer müssen die Schwellenwerte basierend auf dem tatsächlichen Traffic kalibrieren. Prompt-Caching verkompliziert die Token-Kosten, da Cache-Treffer Rabatte erhalten und ein Modellwechsel die Caches auf beiden Seiten abkühlen lässt. Der Artikel weist darauf hin, dass die Komponenten noch jung sind; die Felder ändern sich zwischen Versionen – die Inference Extension hat ihre CRDs vor v1 umbenannt und umstrukturiert. Alles wurde Mitte 2026 auf AKS mit Inference Extension v1.0.0 und agentgateway v1.3.1 Ende-zu-Ende verifiziert. Teams können die Architektur in Phasen übernehmen: Für gemanagte Modelle mit wenigen Agenten reicht agentgateway-Governance aus; für selbst gehostete Einzelmodelle genügen KAITO und Inference Extension ohne semantisches Routing; RouteLLM ist sinnvoll, wenn es eine klare Preislücke zwischen starken und schwachen Modellen gibt und ein erheblicher einfacher Traffic vorhanden ist, was auf fast alle Schleifen-Agenten zutrifft.
Quelle: InfoQ 中国 —
Original
