пары моделей, использованной для обучения RouteLLM; пользователи должны калибровать пороги на основе фактического трафика. Кэширование промптов усложняет затраты на токены, так как попадания в кэш получают скидки, а переключение моделей охлаждает кэши с обеих сторон. Статья предостерегает, что компоненты молоды; поля меняются между версиями - Inference Extension переименовал и перестроил CRD до v1. Все было проверено в конце 2026 года на AKS с Inference Extension v1.0.0 и agentgateway v1.3.1. Команды могут внедрять архитектуру поэтапно: для управляемых моделей с несколькими агентами достаточно управления agentgateway; для самостоятельной одной модели достаточно KAITO и Inference Extension без семантической маршрутизации; RouteLLM оправдан, когда есть четкий разрыв в ценах между сильными и слабыми моделями и значительный простой трафик, что применимо почти ко всем циклическим агентам.