エージェント研究 🇺🇸 27.07.2026 02:04

モデルルーティング:単純?現実に直面するまで

OpenAIOpenAI AnthropicAnthropic
AIモデル間のルーティングは単なる分類問題ではなく、システム最適化の課題です。キャッシュ、インフラストラクチャ、レイテンシ、コンプライアンスなどの実際の要因が支配的であり、価格表やタスクの難易度はあまり役に立ちません。
AIモデル間のルーティングは一見単純に見えて、実際は非常に複雑です。AppWorld Test ChallengeでCodeActエージェントを用いた417タスクのテストでは、GPT-4.1はトークン単価が低いにもかかわらず155ドル(1タスクあたり0.37ドル)のコストがかかり、一方Claude Sonnetは79ドル(1タスクあたり0.19ドル)でした。この差はキャッシュに起因します。Sonnetの低いキャッシュ読み取り価格が、コンテキストを再利用するエージェントワークロードにおいて大きな優位性をもたらしたのです。タスクの難易度はルーティング時点では見えにくく、ルーターはコスト、品質、レイテンシ、コンプライアンス、信頼性を同時に考慮する必要があります。レイテンシはモデルサイズだけでなく、ハードウェアやキャッシュ状態などのインフラ要因にも依存します。著者らは、ルーティングを分類問題ではなく最適化問題として扱うルーターを構築し、コストと精度のフロンティアを生成しました。構成1では、Opus単体での実行と比較して、93ドル、83秒で84%の精度を達成し、コストを21%、レイテンシを9%削減、精度の低下はわずか4%にとどまりました。標準的な難易度ベースのルーター(teal diamond)は同程度の精度でしたが、コストが高くなりました。この最適化は軽量で、タスクあたり約6ミリ秒、2キロバイトのメモリしか消費しません。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース