マイクロソフト、AKS上でのAIエージェントLLMルーティングアーキテクチャを発表、コストを最大85%削減
Microsoft
OpenAI
RouteLLM
マイクロソフトは、Azure Kubernetes Service(AKS)上でエージェントトラフィックをルーティングするためのリファレンスアーキテクチャを公開しました。これは、セマンティックルーティングのためのRouteLLM、ガバナンスのためのagentgateway、そしてGPU対応のロードバランシングのためのKubernetes Gateway API Inference Extensionを組み合わせたものです。この設計は、エージェント型ワークロードを対象としており、多くのLLM呼び出しがフロンティアモデルを必要としないため、コストを最大85%削減できる可能性があります。ただし、削減効果はモデルペアのキャリブレーションとコンポーネントの成熟度に依存します。
マイクロソフトは、Azure Kubernetes Service(AKS)上でエージェントトラフィックをルーティングするためのリファレンスアーキテクチャを公開し、問題を3つの主要な選択肢に分解しました。すなわち、どのモデルが呼び出しに応答するか、呼び出しがどのように管理されるか、そしてどのGPUレプリカがそれを処理するか、という点です。この設計は、負荷分散のためのKubernetes Gateway API Inference Extension、AIプロキシとしてのagentgateway、そしてセマンティックルーティングのためのRouteLLMを組み合わせており、すべてOpenAI互換エンドポイントに接続されています。これは単純なチャットではなく、エージェント型ワークロード向けに調整されています。なぜなら、単一のエージェントタスクが、計画・実行・観察のループの中で数百回のLLM呼び出しを引き起こす可能性があり、そのほとんど(ツール引数の入力、はい/いいえの決定、要約など)はフロンティアモデルを必要としないからです。RouteLLMはプロンプトを検査し、より安価なモデルがより強力なモデルの品質に匹敵するかどうかを予測します。これは、人間の好みデータでトレーニングされた行列分解ルーターを使用します。agentgatewayはOpenAI互換のオープンソースプロキシであり、プロンプトの内容を検査することなく、認証、エージェントごとのレート制限、コスト追跡、ガードレールを管理します。Gateway API Inference ExtensionのEndpoint Pickerは、vLLMのKVキャッシュ使用量やキューの深さなど、GPUのリアルタイムステータスをチェックし、選択されたモデルのどのレプリカがリクエストを処理するかを決定します。セルフホストパスの場合、agentgatewayはext-procを介してEndpoint Pickerを呼び出し、別個のGateway APIゲートウェイをバイパスします。KAITOはオンデマンドでGPUノードプールを提供し、vLLMを実行して、vllm:num_requests_waitingやvllm:kv_cache_usage_percなどのメトリクスを公開します。強力なモデルパスはagentgatewayのAIバックエンドを通ってAzure OpenAIに到達し、弱いモデルパスはサービスバックエンドを介してKAITOが提供するポッドにルーティングされます。AzureマネージドPrometheusとGrafanaは、ルーティング、コスト、GPUメトリクスをスクレイピングして統合ビューを提供します。重要な数値として、RouteLLMのアップグレードしきい値があります。テストされたモデルペアでは、mfルーターはMT-BenchでGPT-4の品質の約95%を達成しながら、呼び出しの約26%だけをGPT-4に送信し、最大85%のコスト削減を実現しました。マイクロソフトは、この数値が自動的ではなく、RouteLLMのトレーニングに使用されるモデルペアに依存することを警告しています。ユーザーは実際のトラフィックに基づいてしきい値を調整する必要があります。プロンプトキャッシュはトークンコストを複雑にします。キャッシュヒットは割引を受けますが、モデルを切り替えると両側のキャッシュが冷えます。この記事では、コンポーネントが新しいものであり、フィールドがバージョン間で変更されること(Inference Extensionはv1より前にCRDを改名・再構築しました)を注意喚起しています。すべては2026年半ばに、AKS上でInference Extension v1.0.0とagentgateway v1.3.1を使用してエンドツーエンドで検証されました。チームはアーキテクチャを段階的に採用できます。マネージドモデルと少数のエージェントの場合、agentgatewayのガバナンスで十分です。セルフホスト単一モデルの場合、セマンティックルーティングなしでKAITOとInference Extensionで十分です。RouteLLMは、強力なモデルと弱いモデルの間に明確な価格差があり、かなりの単純なトラフィックがある場合に価値があります。これは、ほぼすべてのループ型エージェントに当てはまります。
出典: InfoQ 中国 —
原文
