Agentes 🇨🇳 07.08.2026 11:02

Microsoft apresenta arquitetura de roteamento de LLM para agentes de IA no AKS, com redução de custos de até 85%

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
A Microsoft publicou uma arquitetura de referência para roteamento de tráfego de agentes no Azure Kubernetes Service (AKS), combinando o RouteLLM para roteamento semântico, o agentgateway para governança e a Extensão de Inferência da API Gateway do Kubernetes para balanceamento de carga ciente de GPU. O design visa cargas de trabalho de agentes, onde muitas chamadas de LLM não exigem modelos de ponta, potencialmente economizando até 85% nos custos. No entanto, a economia depende da calibração do par de modelos e da maturidade dos componentes.
A Microsoft publicou uma arquitetura de referência para roteamento de tráfego de agentes no Azure Kubernetes Service (AKS), dividindo o problema em três escolhas principais: qual modelo responde a uma chamada, como a chamada é gerenciada e qual réplica de GPU a processa. O design combina a Extensão de Inferência da API Gateway do Kubernetes para balanceamento de carga, o agentgateway como proxy de IA e o RouteLLM para roteamento semântico, todos conectados a um endpoint compatível com OpenAI. Isso é adaptado para cargas de trabalho de agentes, não para chat simples, pois uma única tarefa de agente pode disparar centenas de chamadas de LLM em um loop de planejamento-ação-observação, e a maioria delas (preenchimento de argumentos de ferramentas, decisões sim/não, resumos) não requer um modelo de fronteira. O RouteLLM inspeciona o prompt e prevê se um modelo mais barato pode igualar a qualidade de um modelo mais forte, usando um roteador de fatoração de matriz treinado em dados de preferência humana. O agentgateway, um proxy de código aberto compatível com OpenAI, gerencia autenticação, limites de taxa por agente, rastreamento de custos e salvaguardas sem inspecionar o conteúdo do prompt. A Seleção de Endpoint da Extensão de Inferência da API Gateway verifica o status da GPU em tempo real, incluindo o uso de cache KV do vLLM e a profundidade da fila, para decidir qual réplica do modelo selecionado atende à solicitação. Para caminhos auto-hospedados, o agentgateway chama o Seletor de Endpoint via ext-proc, contornando um gateway separado da API Gateway. O KAITO fornece pools de nós GPU sob demanda e executa o vLLM, expondo métricas como vllm:num_requests_waiting e vllm:kv_cache_usage_perc. O caminho do modelo forte passa pelo backend de IA do agentgateway para o Azure OpenAI, enquanto o caminho do modelo fraco roteia via backend de serviço para pods atendidos pelo KAITO. O Prometheus e o Grafana gerenciados pelo Azure coletam métricas de roteamento, custo e GPU para uma visão unificada. Um número-chave é o limite de atualização do RouteLLM: nos pares de modelos testados, o roteador mf alcançou cerca de 95% da qualidade do GPT-4 no MT-Bench enquanto enviava apenas cerca de 26% das chamadas para o GPT-4, economizando até 85% nos custos. A Microsoft adverte que esse número não é automático e depende do par de modelos usado para treinar o RouteLLM; os usuários devem calibrar os limites com base no tráfego real. O cache de prompt complica os custos de token, pois acertos de cache recebem descontos, e a troca de modelos esfria os caches em ambos os lados. O artigo alerta que os componentes são novos; os campos mudam entre versões—a Extensão de Inferência renomeou e reestruturou os CRDs antes da v1. Tudo foi verificado de ponta a ponta em meados de 2026 no AKS com a Extensão de Inferência v1.0.0 e o agentgateway v1.3.1. As equipes podem adotar a arquitetura em fases: para modelos gerenciados com poucos agentes, a governança do agentgateway é suficiente; para modelo único auto-hospedado, KAITO e Extensão de Inferência são suficientes sem roteamento semântico; o RouteLLM vale a pena quando há uma diferença clara de preço entre modelos fortes e fracos e tráfego simples considerável, o que se aplica a quase todos os agentes em loop.
Fonte: InfoQ 中国 — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas