Agents 🇨🇳 07.08.2026 11:02

Microsoft dévoile une architecture de routage LLM pour agents sur AKS, réduisant les coûts jusqu'à 85 %

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
Microsoft a publié une architecture de référence pour router le trafic des agents sur Azure Kubernetes Service (AKS), combinant RouteLLM pour le routage sémantique, agentgateway pour la gouvernance, et l'extension Kubernetes Gateway API Inference pour l'équilibrage de charge tenant compte des GPU. La conception cible les charges de travail agentiques, où de nombreux appels LLM ne nécessitent pas de modèles de pointe, permettant potentiellement d'économiser jusqu'à 85 % sur les coûts. Cependant, les économies dépendent de l'étalonnage des paires de modèles et de la maturité des composants.
Microsoft a publié une architecture de référence pour acheminer le trafic des agents sur Azure Kubernetes Service (AKS), décomposant le problème en trois choix clés : quel modèle répond à un appel, comment l'appel est géré, et quelle réplique GPU le traite. La conception combine l'extension d'inférence de l'API Gateway Kubernetes pour l'équilibrage de charge, agentgateway comme proxy IA, et RouteLLM pour le routage sémantique, le tout connecté à un point de terminaison compatible OpenAI. Cela est adapté aux charges de travail agentiques plutôt qu'au simple chat, car une seule tâche d'agent peut déclencher des centaines d'appels LLM dans une boucle de planification-action-observation, dont la plupart (remplissage des arguments d'outil, décisions oui/non, résumés) ne nécessitent pas un modèle de pointe. RouteLLM inspecte le prompt et prédit si un modèle moins cher peut égaler la qualité d'un modèle plus fort, en utilisant un routeur à factorisation matricielle entraîné sur des données de préférences humaines. Agentgateway, un proxy open source compatible OpenAI, gère l'authentification, les limites de débit par agent, le suivi des coûts et les garde-fous sans inspecter le contenu du prompt. L'extension d'inférence de l'API Gateway, via son sélecteur de point de terminaison, vérifie l'état en temps réel du GPU, y compris l'utilisation du cache KV de vLLM et la profondeur de file d'attente, pour décider quelle réplique du modèle sélectionné traite la requête. Pour les chemins auto-hébergés, agentgateway appelle le sélecteur de point de terminaison via ext-proc, contournant une passerelle API Gateway distincte. KAITO fournit des pools de nœuds GPU à la demande et exécute vLLM, exposant des métriques comme vllm:num_requests_waiting et vllm:kv_cache_usage_perc. Le chemin du modèle fort passe par le backend IA d'agentgateway vers Azure OpenAI, tandis que le chemin du modèle faible passe par un backend de service vers les pods servis par KAITO. Prometheus et Grafana gérés par Azure collectent les métriques de routage, de coût et de GPU pour une vue unifiée. Un chiffre clé est le seuil de mise à niveau de RouteLLM : sur les paires de modèles testées, le routeur mf a atteint environ 95 % de la qualité de GPT-4 sur MT-Bench tout en envoyant seulement environ 26 % des appels à GPT-4, économisant jusqu'à 85 % des coûts. Microsoft avertit que ce chiffre n'est pas automatique et dépend de la paire de modèles utilisée pour entraîner RouteLLM ; les utilisateurs doivent calibrer les seuils en fonction du trafic réel. La mise en cache des prompts complique les coûts de tokens, car les hits de cache bénéficient de réductions, et le changement de modèle refroidit les caches des deux côtés. L'article précise que les composants sont jeunes ; les champs changent entre les versions — l'extension d'inférence a renommé et restructuré les CRD avant la v1. Tout a été vérifié de bout en bout à la mi-2026 sur AKS avec l'extension d'inférence v1.0.0 et agentgateway v1.3.1. Les équipes peuvent adopter l'architecture par phases : pour les modèles gérés avec peu d'agents, la gouvernance d'agentgateway suffit ; pour un modèle unique auto-hébergé, KAITO et l'extension d'inférence suffisent sans routage sémantique ; RouteLLM est utile lorsqu'il y a un écart de prix clair entre les modèles forts et faibles et un trafic simple considérable, ce qui s'applique à presque tous les agents en boucle.
Source: InfoQ 中国 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches