Microsoft julkaisee tekoälyagenttien LLM-reititysarkkitehtuurin AKS:ssä, kustannussäästöt jopa 85 %
Microsoft
OpenAI
RouteLLM
Microsoft on julkaissut viitearkkitehtuurin agenttiliikenteen reitittämiseen Azure Kubernetes Service (AKS) -palvelussa, yhdistäen RouteLLM:n semanttiseen reititykseen, agentgatewayn hallintaan ja Kubernetes Gateway API -laajennuksen Inference Extension -ominaisuuden GPU-tietoiseen kuormituksen tasaukseen. Suunnittelu kohdistuu agenttityökuormiin, joissa monet LLM-kutsut eivät vaadi huippumalleja, mikä voi säästää jopa 85 % kustannuksista. Säästöt riippuvat kuitenkin malliparien kalibroinnista ja komponenttien kypsyydestä.
Microsoft on julkaissut referenssiarkkitehtuurin agenttiliikenteen reitittämiseen Azure Kubernetes Servicessä (AKS) ja pilkkonut ongelman kolmeen keskeiseen valintaan: mikä malli vastaa kutsuun, miten kutsua hallinnoidaan ja mikä GPU-replika käsittelee sen. Suunnittelussa yhdistyvät Kubernetes Gateway API Inference Extension kuormituksen tasapainotukseen, agentgateway tekoälyproxyksi ja RouteLLM semanttiseen reititykseen, kaikki yhdistettynä OpenAI-yhteensopivaan päätepisteeseen. Tämä on räätälöity agenttityyppisiin työmääriin eikä pelkkään chattiin, koska yksi agenttitehtävä voi laukaista satoja LLM-kutsuja suunnittelu-toiminta-havainnointi-silmukassa, joista useimmat (työkaluargumenttien täyttö, kyllä/ei-päätökset, yhteenvedot) eivät vaadi huippumallia. RouteLLM tarkastaa kehotteen ja ennustaa, voiko halvempi malli vastata vahvemman mallin laatua käyttäen matriisifaktorointireititintä, joka on koulutettu ihmisten mieltymysdatalla. Agentgateway, avoimen lähdekoodin OpenAI-yhteensopiva proxy, hallinnoi autentikointia, agenttikohtaisia nopeusrajoituksia, kustannusseurantaa ja suojakaiteita tarkastamatta kehotteen sisältöä. Gateway API Inference Extensionin Endpoint Picker tarkistaa reaaliaikaisen GPU-tilan, mukaan lukien vLLM:n KV-välimuistin käytön ja jonon syvyyden, päättääkseen, mikä valitun mallin replika käsittelee pyynnön. Itse isännöidyissä poluissa agentgateway kutsuu Endpoint Pickeriä ext-proc:n kautta ohittaen erillisen Gateway API -yhdyskäytävän. KAITO tarjoaa GPU-solmuryhmiä tarpeen mukaan ja ajaa vLLM:ää paljastaen mittareita, kuten vllm:num_requests_waiting ja vllm:kv_cache_usage_perc. Vahvan mallin polku kulkee agentgatewayn tekoäly-taustajärjestelmän kautta Azure OpenAI:hin, kun taas heikon mallin polku reititetään palvelutaustajärjestelmän kautta KAITO:n tarjoilemiin podiin. Azure-hallinnoitu Prometheus ja Grafana keräävät reititys-, kustannus- ja GPU-mittarit yhtenäistä näkymää varten. Keskeinen luku on RouteLLM:n päivityskynnys: testatuilla mallipareilla mf-reititin saavutti noin 95 prosenttia GPT-4:n laadusta MT-Benchissä lähettäen vain noin 26 prosenttia kutsuista GPT-4:lle, säästäen jopa 85 prosenttia kustannuksista. Microsoft varoittaa, että tämä luku ei ole automaattinen ja riippuu RouteLLM:n koulutukseen käytetystä malliparista; käyttäjien on kalibroitava kynnykset todellisen liikenteen perusteella. Kehotteen välimuistitus monimutkaistaa token-kustannuksia, koska välimuistiosumat saavat alennuksia, ja mallin vaihtaminen jäähdyttää välimuistit molemmilla puolilla. Artikkeli varoittaa, että komponentit ovat nuoria; kentät muuttuvat versioiden välillä – Inference Extension uudelleennimettiin ja CRD:t rakennettiin uudelleen ennen v1:tä. Kaikki varmennettiin päästä päähän vuoden 2026 puolivälissä AKS:ssä Inference Extension v1.0.0:lla ja agentgateway v1.3.1:llä. Tiimit voivat ottaa arkkitehtuurin käyttöön vaiheittain: hallituille malleille, joissa on vähän agentteja, agentgatewayn hallinta riittää; itse isännöidylle yhden mallin tapauksessa KAITO ja Inference Extension riittävät ilman semanttista reititystä; RouteLLM on hyödyllinen, kun vahvojen ja heikkojen mallien välillä on selvä hintaero ja huomattava määrä yksinkertaista liikennettä, mikä koskee lähes kaikkia silmukoivia agentteja.
Lähde: InfoQ 中国 —
Alkuperäinen
