маршрутизации, все подключено к совместимому с OpenAI конечной точке. Это рассчитано на агентные нагрузки, а не на простые чаты, так как одна задача агента может вызвать сотни вызовов LLM в цикле планирования-действия-наблюдения, большинство из которых (заполнение аргументов инструментов, решения да/нет, сводки) не требуют передовой модели. RouteLLM проверяет промпт и предсказывает, может ли более дешевая модель соответствовать качеству более сильной, используя маршрутизатор факторизации матрицы, обученный на данных человеческих предпочтений. agentgateway, прокси с открытым исходным кодом, совместимый с OpenAI, управляет аутентификацией, ограничениями скорости на агента, отслеживанием затрат и ограничениями без проверки содержимого промпта. Endpoint Picker из Gateway API Inference Extension проверяет статус GPU в реальном времени, включая использование KV-кэша vLLM и глубину очереди, чтобы решить, какая реплика выбранной модели обрабатывает запрос. Для самостоятельных путей agentgateway вызывает Endpoint Picker через ext-proc, минуя отдельный шлюз Gateway API. KAITO предоставляет пулы узлов GPU по требованию и запускает vLLM, предоставляя метрики, такие как vllm:num_requests_waiting и vllm:kv_cache_usage_perc. Путь сильной модели проходит через AI-бэкенд agentgateway к Azure OpenAI, в то время как путь слабой модели маршрутизируется через сервисный бэкенд к подам, обслуживаемым KAITO. Управляемые Prometheus и Grafana Azure собирают метрики маршрутизации, затрат и GPU для единого представления. Ключевое число - порог обновления RouteLLM: на протестированных парах моделей маршрутизатор mf достиг примерно 95% качества GPT-4 на MT-Bench, отправляя только около 26% вызовов к GPT-4, экономя до 85% затрат. Microsoft предупреждает, что эта цифра не автоматическая и зависит от
Показать ещё ↓