Enrutamiento de modelos: ¿sencillo? Hasta que te topas con la realidad
OpenAI
Anthropic
El enrutamiento entre modelos de IA no es solo un problema de clasificación, sino un desafío de optimización de sistemas. Factores del mundo real como el almacenamiento en caché, la infraestructura, la latencia y el cumplimiento normativo dominan, lo que convierte a las hojas de precios y la dificultad de las tareas en guías deficientes.
El enrutamiento entre modelos de IA es engañosamente complejo. En pruebas con 417 tareas en AppWorld Test Challenge utilizando el agente CodeAct, GPT-4.1 costó $155 ($0,37 por tarea), mientras que Claude Sonnet costó $79 ($0,19 por tarea), a pesar de que GPT-4.1 tiene un precio por token más bajo. La diferencia provino del almacenamiento en caché: el precio más bajo de lectura de caché de Sonnet le dio una gran ventaja en cargas de trabajo de agentes con contexto reutilizado. La dificultad de la tarea a menudo es invisible en el momento del enrutamiento, y los enrutadores deben equilibrar simultáneamente costo, calidad, latencia, cumplimiento normativo y fiabilidad. La latencia depende de factores de infraestructura como el hardware y el estado de la caché, no solo del tamaño del modelo. Los autores construyeron un enrutador que trata el enrutamiento como un problema de optimización, no de clasificación, produciendo una frontera costo-precisión. La Configuración 1 logró un 84% de precisión por $93 y 83 segundos, reduciendo el costo en un 21% y la latencia en un 9% en comparación con ejecutar Opus solo, con solo un 4% de caída en precisión. Un enrutador estándar basado en dificultad (diamante verde azulado) tuvo una precisión similar pero un costo más alto. La optimización es ligera: aproximadamente 6 milisegundos y 2 kilobytes de memoria por tarea.
Fuente: Hugging Face blog —
original
