एजेंटशोध 🇺🇸 27.07.2026 02:04

Model Routing: सरल? जब तक आप वास्तविकता से न टकराएं

OpenAIOpenAI AnthropicAnthropic
AI मॉडलों के बीच रूटिंग सिर्फ एक वर्गीकरण समस्या नहीं है, बल्कि एक सिस्टम ऑप्टिमाइज़ेशन चुनौती है। कैशिंग, इन्फ्रास्ट्रक्चर, लेटेंसी और अनुपालन जैसे वास्तविक दुनिया के कारक हावी होते हैं, जिससे मूल्य सूची और कार्य कठिनाई खराब मार्गदर्शक बन जाते हैं।
AI मॉडलों के बीच रूटिंग वास्तव में जटिल है। AppWorld Test Challenge पर CodeAct एजेंट का उपयोग करके 417 कार्यों के परीक्षणों में, GPT-4.1 की लागत $155 ($0.37/कार्य) थी जबकि Claude Sonnet की लागत $79 ($0.19/कार्य) थी, इस तथ्य के बावजूद कि GPT-4.1 का प्रति टोकन मूल्य कम था। यह अंतर कैशिंग के कारण आया: Sonnet के कम कैश-रीड मूल्य ने इसे पुन: उपयोग किए गए संदर्भ वाले एजेंट वर्कलोड में बड़ा लाभ दिया। कार्य की कठिनाई अक्सर रूटिंग के समय अदृश्य होती है, और राउटर को एक साथ लागत, गुणवत्ता, विलंबता, अनुपालन और विश्वसनीयता को संतुलित करना होता है। विलंबता केवल मॉडल आकार पर नहीं, बल्कि हार्डवेयर और कैश स्थिति जैसे बुनियादी ढांचे के कारकों पर निर्भर करती है। लेखकों ने एक राउटर बनाया जो रूटिंग को वर्गीकरण नहीं बल्कि एक अनुकूलन समस्या मानता है, जो लागत-सटीकता सीमा तैयार करता है। कॉन्फ़िगरेशन 1 ने $93 और 83 सेकंड में 84% सटीकता प्राप्त की, जो अकेले Opus चलाने की तुलना में लागत में 21% और विलंबता में 9% की कमी थी, जिसमें केवल 4% सटीकता में गिरावट थी। एक मानक कठिनाई-आधारित राउटर (टील डायमंड) की सटीकता समान थी लेकिन लागत अधिक थी। अनुकूलन हल्का है: प्रति कार्य लगभग 6 मिलीसेकंड और 2 किलोबाइट मेमोरी।
स्रोत: Hugging Face blog — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार