Routage des modèles : simple ? jusqu'à ce que vous affrontiez la réalité
OpenAI
Anthropic
Le routage entre modèles d'IA n'est pas seulement un problème de classification, mais un défi d'optimisation des systèmes. Les facteurs réels comme la mise en cache, l'infrastructure, la latence et la conformité dominent, rendant les grilles tarifaires et la difficulté des tâches de mauvais guides.
Le routage entre modèles d'IA est d'une complexité trompeuse. Lors de tests portant sur 417 tâches d'AppWorld Test Challenge avec l'agent CodeAct, GPT-4.1 a coûté 155 $ (0,37 $/tâche) tandis que Claude Sonnet a coûté 79 $ (0,19 $/tâche), bien que GPT-4.1 ait un tarif par jeton inférieur. La différence venait de la mise en cache : le tarif de lecture en cache plus bas de Sonnet lui a donné un avantage considérable dans les charges de travail d'agent avec contexte réutilisé. La difficulté des tâches est souvent invisible au moment du routage, et les routeurs doivent équilibrer simultanément coût, qualité, latence, conformité et fiabilité. La latence dépend de facteurs d'infrastructure comme le matériel et l'état du cache, pas seulement de la taille du modèle. Les auteurs ont construit un routeur qui traite le routage comme un problème d'optimisation, et non de classification, produisant une frontière coût-précision. La configuration 1 a atteint 84 % de précision pour 93 $ et 83 secondes, réduisant le coût de 21 % et la latence de 9 % par rapport à l'utilisation d'Opus seul, avec seulement 4 % de baisse de précision. Un routeur standard basé sur la difficulté (losange turquoise) avait une précision similaire mais un coût plus élevé. L'optimisation est légère : environ 6 millisecondes et 2 kilo-octets de mémoire par tâche.
Source: Hugging Face blog —
original
