마이크로소프트, AKS에서 AI 에이전트 LLM 라우팅 아키텍처 공개, 비용 최대 85% 절감
Microsoft
OpenAI
RouteLLM
마이크로소프트가 Azure Kubernetes Service(AKS)에서 에이전트 트래픽을 라우팅하기 위한 참조 아키텍처를 공개했습니다. 이는 의미 기반 라우팅을 위한 RouteLLM, 거버넌스를 위한 agentgateway, GPU 인식 로드 밸런싱을 위한 Kubernetes Gateway API Inference Extension을 결합한 설계입니다. 이 설계는 많은 LLM 호출이 프런티어 모델을 필요로 하지 않는 에이전트 워크로드를 대상으로 하며, 잠재적으로 비용을 최대 85%까지 절감할 수 있습니다. 그러나 절감 효과는 모델 쌍 보정과 구성 요소의 성숙도에 따라 달라집니다.
Microsoft가 AKS(Azure Kubernetes Service)에서 에이전트 트래픽을 라우팅하기 위한 참조 아키텍처를 공개했습니다. 이는 문제를 세 가지 주요 선택으로 나눕니다: 어떤 모델이 호출에 응답할지, 호출이 어떻게 관리되는지, 그리고 어떤 GPU 복제본이 이를 처리할지입니다. 이 설계는 로드 밸런싱을 위한 Kubernetes Gateway API Inference Extension, AI 프록시로서의 agentgateway, 그리고 의미적 라우팅을 위한 RouteLLM을 결합하여 모두 OpenAI 호환 엔드포인트에 연결됩니다. 이는 단순한 채팅보다는 에이전트 워크로드에 맞춰져 있습니다. 단일 에이전트 작업은 계획-행동-관찰 루프에서 수백 번의 LLM 호출을 트리거할 수 있으며, 대부분(도구 인수 채우기, 예/아니오 결정, 요약)은 프런티어 모델을 필요로 하지 않기 때문입니다. RouteLLM은 프롬프트를 검사하고 더 저렴한 모델이 더 강력한 모델의 품질과 일치할 수 있는지 예측하며, 인간 선호도 데이터로 훈련된 행렬 분해 라우터를 사용합니다. agentgateway는 OpenAI와 호환되는 오픈소스 프록시로, 프롬프트 내용을 검사하지 않고 인증, 에이전트별 속도 제한, 비용 추적, 그리고 안전장치를 관리합니다. Gateway API Inference Extension의 Endpoint Picker는 실시간 GPU 상태(vLLM의 KV 캐시 사용량 및 큐 깊이 포함)를 확인하여 선택된 모델의 어떤 복제본이 요청을 처리할지 결정합니다. 자체 호스팅 경로의 경우, agentgateway는 별도의 Gateway API 게이트웨이를 우회하여 ext-proc를 통해 Endpoint Picker를 호출합니다. KAITO는 주문형 GPU 노드 풀을 제공하고 vLLM을 실행하며, vllm:num_requests_waiting 및 vllm:kv_cache_usage_perc와 같은 메트릭을 노출합니다. 강력한 모델 경로는 agentgateway의 AI 백엔드를 통해 Azure OpenAI로 이동하는 반면, 약한 모델 경로는 서비스 백엔드를 통해 KAITO가 제공하는 포드로 라우팅됩니다. Azure 관리형 Prometheus 및 Grafana는 라우팅, 비용, GPU 메트릭을 수집하여 통합된 보기를 제공합니다. 핵심 수치는 RouteLLM의 업그레이드 임계값입니다: 테스트된 모델 쌍에서 mf 라우터는 GPT-4로 보내는 호출의 약 26%만으로 MT-Bench에서 GPT-4 품질의 약 95%를 달성하여 최대 85%의 비용을 절감했습니다. Microsoft는 이 수치가 자동으로 나오는 것이 아니며 RouteLLM을 훈련하는 데 사용된 모델 쌍에 따라 달라진다고 경고합니다. 사용자는 실제 트래픽을 기반으로 임계값을 보정해야 합니다. 프롬프트 캐싱은 토큰 비용을 복잡하게 만듭니다. 캐시 적중 시 할인이 적용되고, 모델을 전환하면 양쪽의 캐시가 냉각되기 때문입니다. 기사는 구성 요소가 초기 단계에 있으며 필드가 버전 간에 변경된다고 경고합니다. Inference Extension은 v1 이전에 CRD를 이름 변경하고 재구성했습니다. 모든 것은 2026년 중반에 AKS에서 Inference Extension v1.0.0 및 agentgateway v1.3.1과 함께 엔드투엔드로 검증되었습니다. 팀은 단계적으로 아키텍처를 채택할 수 있습니다: 관리형 모델과 소수의 에이전트가 있는 경우 agentgateway 거버넌스로 충분합니다. 자체 호스팅 단일 모델의 경우 KAITO와 Inference Extension만으로 충분하며 의미적 라우팅은 필요하지 않습니다. RouteLLM은 강한 모델과 약한 모델 간에 명확한 가격 차이가 있고 상당한 단순 트래픽이 있을 때 유용하며, 이는 거의 모든 루핑 에이전트에 적용됩니다.
출처: InfoQ 中国 —
원문
