智能体 🇨🇳 07.08.2026 11:02

微软在AKS上发布AI智能体LLM路由架构,最高降低成本85%

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
微软发布了一套在Azure Kubernetes Service(AKS)上路由智能体流量的参考架构,结合了RouteLLM进行语义路由、agentgateway进行治理,以及Kubernetes Gateway API推理扩展用于GPU感知的负载均衡。该设计面向智能体工作负载,其中许多大型语言模型(LLM)调用不需要前沿模型,因此最高可节省85%的成本。然而,节省效果取决于模型对的校准以及各组件的成熟度。
微软发布了一份关于在Azure Kubernetes Service(AKS)上路由代理流量的参考架构,将问题分解为三个关键选择:哪个模型响应用户呼叫,如何管理呼叫,以及哪个GPU副本处理它。该设计结合了Kubernetes网关API推理扩展用于负载均衡,agentgateway作为AI代理,以及RouteLLM用于语义路由,所有组件都连接到兼容OpenAI的端点。这针对的是代理型工作负载,而非简单的聊天,因为单个代理任务可能在计划-行动-观察循环中触发数百次LLM调用,而其中大多数调用(填充工具参数、是/否决策、摘要)并不需要前沿模型。RouteLLM检查提示,并预测较便宜的模型是否能达到更强模型的质量,它使用基于人类偏好数据训练出的矩阵分解路由器。Agentgateway是一个兼容OpenAI的开源代理,它管理身份验证、每个代理的速率限制、成本跟踪和护栏,而不会检查提示内容。网关API推理扩展的端点选择器会检查实时的GPU状态,包括vLLM的KV缓存使用率和队列深度,以决定所选模型的哪个副本处理请求。对于自托管路径,agentgateway通过ext-proc调用端点选择器,绕过了单独的网关API网关。KAITO按需提供GPU节点池并运行vLLM,暴露诸如vllm:num_requests_waiting和vllm:kv_cache_usage_perc之类的指标。强模型路径通过agentgateway的AI后端进入Azure OpenAI,而弱模型路径则通过服务后端路由到KAITO服务的Pod。Azure托管的Prometheus和Grafana会抓取路由、成本和GPU指标,以提供统一视图。一个关键数字是RouteLLM的升级阈值:在测试的模型对上,mf路由器在MT-Bench上达到了GPT-4质量的约95%,而仅将约26%的调用发送给GPT-4,节省了高达85%的成本。微软警告说这一数字并非自动实现,取决于用于训练RouteLLM的模型对;用户必须根据实际流量校准阈值。提示缓存使令牌成本复杂化,因为缓存命中可获得折扣,而切换模型会使双方的缓存变冷。文章提醒说组件还很年轻;字段在版本之间会变化——推理扩展在v1之前就已重命名并重构了CRD。所有这些已在2026年年中在AKS上使用推理扩展v1.0.0和agentgateway v1.3.1进行了端到端验证。团队可以分阶段采用该架构:对于代理数量较少的托管模型,agentgateway治理就足够了;对于自托管单模型,KAITO和推理扩展就足够了,无需语义路由;当强模型和弱模型之间存在明显的价格差距且简单流量相当可观时,RouteLLM就值得使用,而这几乎适用于所有循环代理。
来源: InfoQ 中国 — 原文
我们之前关于此话题的帖子 ↓
最新新闻