Model Yönlendirme: Basit mi? Gerçeklikle Yüzleşene Kadar
OpenAI
Anthropic
Yapay zeka modelleri arasında yönlendirme yapmak sadece bir sınıflandırma sorunu değil, aynı zamanda bir sistem optimizasyonu zorluğudur. Önbelleğe alma, altyapı, gecikme süresi ve uyumluluk gibi gerçek dünya faktörleri baskın hale gelir ve fiyat tabloları ile görev zorluğunu zayıf kılavuzlar haline getirir.
Yapay zeka modelleri arasında yönlendirme yapmak, göründüğünden daha karmaşıktır. AppWorld Test Challenge'da CodeAct ajanı kullanılarak 417 görev üzerinde yapılan testlerde, GPT-4.1'in maliyeti 155 dolar (görev başına 0,37 dolar) iken Claude Sonnet'in maliyeti 79 dolar (görev başına 0,19 dolar) olmuştur; oysa GPT-4.1'in token başına fiyatlandırması daha düşüktür. Fark, önbelleklemeden kaynaklanmıştır: Sonnet'in daha düşük önbellek okuma fiyatlandırması, yeniden kullanılan bağlam içeren ajan iş yüklerinde ona büyük bir avantaj sağlamıştır. Görev zorluğu, yönlendirme anında genellikle görünmezdir ve yönlendiriciler aynı anda maliyet, kalite, gecikme süresi, uyumluluk ve güvenilirliği dengelemek zorundadır. Gecikme süresi, yalnızca model boyutuna değil, donanım ve önbellek durumu gibi altyapı faktörlerine de bağlıdır. Yazarlar, yönlendirmeyi bir sınıflandırma değil, bir optimizasyon problemi olarak ele alan ve bir maliyet-doğruluk sınırı üreten bir yönlendirici inşa etmiştir. Konfigürasyon 1, 93 dolar ve 83 saniye ile %84 doğruluk elde etmiş, yalnızca Opus'u çalıştırmaya kıyasla maliyeti %21 ve gecikme süresini %9 azaltmış, doğrulukta ise yalnızca %4 düşüş yaşanmıştır. Standart bir zorluk tabanlı yönlendirici (turkuaz elmas) benzer doğruluk ancak daha yüksek maliyet göstermiştir. Optimizasyon hafiftir: görev başına yaklaşık 6 milisaniye ve 2 kilobayt bellek kullanır.
Kaynak: Hugging Face blog —
orijinal
