AgentenOnderzoek 🇺🇸 27.07.2026 02:04

Model Routering: Simpel? Totdat je de Realiteit Tegenkomt

OpenAIOpenAI AnthropicAnthropic
Routering tussen AI-modellen is niet alleen een classificatieprobleem, maar een systeemoptimalisatie-uitdaging. Factoren uit de echte wereld zoals caches, infrastructuur, latentie en naleving domineren, waardoor prijslijsten en taakmoeilijkheid slechte richtlijnen zijn.
Het routeren tussen AI-modellen is bedrieglijk complex. In tests met 417 taken op de AppWorld Test Challenge met behulp van de CodeAct-agent kostte GPT-4.1 $155 ($0,37 per taak), terwijl Claude Sonnet $79 kostte ($0,19 per taak), ondanks dat GPT-4.1 lagere prijzen per token heeft. Het verschil kwam door caching: Sonnet's lagere prijzen voor het lezen van cache gaven het een groot voordeel bij agentworkloads met hergebruikte context. De moeilijkheidsgraad van taken is vaak onzichtbaar op het moment van routeren, en routers moeten tegelijkertijd een balans vinden tussen kosten, kwaliteit, latentie, compliance en betrouwbaarheid. Latentie hangt af van infrastructuurfactoren zoals hardware en cachestatus, niet alleen van modelgrootte. De auteurs bouwden een router die routeren behandelt als een optimalisatieprobleem, niet als classificatie, en produceerden een grens tussen kosten en nauwkeurigheid. Configuratie 1 behaalde 84% nauwkeurigheid voor $93 en 83 seconden, wat de kosten met 21% en de latentie met 9% verlaagde in vergelijking met het alleen draaien van Opus, met slechts 4% daling in nauwkeurigheid. Een standaard op moeilijkheid gebaseerde router (teal diamond) had vergelijkbare nauwkeurigheid maar hogere kosten. De optimalisatie is lichtgewicht: ongeveer 6 milliseconden en 2 kilobyte geheugen per taak.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws