Ajanlar 🇨🇳 07.08.2026 11:02

Microsoft, AKS Üzerinde Yapay Zeka Ajanı LLM Yönlendirme Mimarisi Tanıttı: Maliyetleri Yüzde 85'e Kadar Düşürüyor

MicrosoftMicrosoft OpenAIOpenAI RouteLLMRouteLLM
Microsoft, Azure Kubernetes Service (AKS) üzerinde ajan trafiğini yönlendirmek için referans bir mimari yayınladı. Bu mimari, semantik yönlendirme için RouteLLM'ü, yönetişim için agentgateway'i ve GPU farkındalıklı yük dengeleme için Kubernetes Gateway API Inference Extension'ı birleştiriyor. Tasarım, birçok LLM çağrısının öncü modeller gerektirmediği ajan tabanlı iş yüklerini hedefliyor ve potansiyel olarak maliyetlerde yüzde 85'e varan tasarruf sağlıyor. Ancak tasarruflar, model çifti kalibrasyonuna ve bileşenlerin olgunluğuna bağlı.
Microsoft, Azure Kubernetes Service (AKS) üzerinde ajan trafiğini yönlendirmek için bir referans mimarisi yayınladı ve sorunu üç temel seçeneğe ayırdı: hangi modelin bir çağrıya yanıt vereceği, çağrının nasıl yönetileceği ve hangi GPU kopyasının (replica) bunu ele alacağı. Tasarım, yük dengeleme için Kubernetes Gateway API Inference Extension, bir yapay zeka (AI) proxy'si olarak agentgateway ve anlamsal (semantik) yönlendirme için RouteLLM'ü birleştiriyor; hepsi OpenAI uyumlu bir uç noktaya (endpoint) bağlı. Bu, basit sohbetten ziyade ajan odaklı iş yükleri için uyarlanmıştır; zira tek bir ajan görevi, planlama-eylem-gözlem döngüsünde yüzlerce LLM çağrısını tetikleyebilir ve bunların çoğu (araç argümanlarını doldurma, evet/hayır kararları, özetler) öncü (frontier) bir model gerektirmez. RouteLLM, istemi inceler ve daha ucuz bir modelin daha güçlü bir modelin kalitesine ulaşıp ulaşamayacağını tahmin eder; insan tercihi verileriyle eğitilmiş bir matris çarpanlarına ayırma yönlendiricisi kullanır. OpenAI ile uyumlu açık kaynaklı bir proxy olan agentgateway, istem içeriğini incelemeden kimlik doğrulama, ajan başına hız sınırları, maliyet takibi ve güvenlik önlemlerini (guardrails) yönetir. Gateway API Inference Extension'ın Endpoint Picker'ı, seçilen modelin hangi kopyasının isteği ele alacağına karar vermek için vLLM'in KV önbellek kullanımı ve kuyruk derinliği dahil olmak üzere gerçek zamanlı GPU durumunu kontrol eder. Kendi kendine barındırılan yollar için agentgateway, ayrı bir Gateway API ağ geçidini atlayarak Endpoint Picker'ı ext-proc üzerinden çağırır. KAITO, talep üzerine GPU düğüm havuzları sağlar ve vLLM çalıştırarak vllm:num_requests_waiting ve vllm:kv_cache_usage_perc gibi metrikleri açığa çıkarır. Güçlü model yolu, agentgateway'in yapay zeka arka ucundan Azure OpenAI'ye giderken, zayıf model yolu bir hizmet arka ucu üzerinden KAITO tarafından sunulan podlara yönlendirilir. Azure tarafından yönetilen Prometheus ve Grafana, birleşik bir görünüm için yönlendirme, maliyet ve GPU metriklerini toplar. Önemli bir sayı, RouteLLM'in yükseltme eşiğidir: test edilen model çiftlerinde mf yönlendiricisi, MT-Bench'te GPT-4'ün kalitesinin yaklaşık %95'ine ulaşırken çağrıların yalnızca yaklaşık %26'sını GPT-4'e göndererek maliyetlerde %85'e varan tasarruf sağladı. Microsoft, bu rakamın otomatik olmadığı ve RouteLLM'in eğitiminde kullanılan model çiftine bağlı olduğu konusunda uyarıyor; kullanıcılar eşikleri gerçek trafiğe göre kalibre etmelidir. İstem önbellekleme, önbellek isabetlerinde indirimler sağladığı ve model değiştirildiğinde her iki tarafta da önbelleklerin soğumasına neden olduğu için token maliyetlerini karmaşıklaştırır. Makale, bileşenlerin yeni olduğunu ve sürümler arasında alan adlarının değiştiğini belirtiyor—Inference Extension, v1'den önce CRD'leri yeniden adlandırdı ve yeniden yapılandırdı. Her şey, 2026'nın ortasında AKS üzerinde Inference Extension v1.0.0 ve agentgateway v1.3.1 ile uçtan uca doğrulandı. Ekipler mimariyi aşamalı olarak benimseyebilir: az sayıda ajanı olan yönetilen modeller için agentgateway yönetişimi yeterlidir; kendi kendine barındırılan tek model için anlamsal yönlendirme olmadan KAITO ve Inference Extension yeterlidir; RouteLLM, güçlü ve zayıf modeller arasında net bir fiyat farkı olduğunda ve önemli miktarda basit trafik olduğunda değerlidir; bu da neredeyse tüm döngüsel ajanlar için geçerlidir.
Kaynak: InfoQ 中国 — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler