Model Routing: सरल? जब तक आप वास्तविकता से न टकराएं
OpenAI
Anthropic
AI मॉडलों के बीच रूटिंग सिर्फ एक वर्गीकरण समस्या नहीं है, बल्कि एक सिस्टम ऑप्टिमाइज़ेशन चुनौती है। कैशिंग, इन्फ्रास्ट्रक्चर, लेटेंसी और अनुपालन जैसे वास्तविक दुनिया के कारक हावी होते हैं, जिससे मूल्य सूची और कार्य कठिनाई खराब मार्गदर्शक बन जाते हैं।
AI मॉडलों के बीच रूटिंग वास्तव में जटिल है। AppWorld Test Challenge पर CodeAct एजेंट का उपयोग करके 417 कार्यों के परीक्षणों में, GPT-4.1 की लागत $155 ($0.37/कार्य) थी जबकि Claude Sonnet की लागत $79 ($0.19/कार्य) थी, इस तथ्य के बावजूद कि GPT-4.1 का प्रति टोकन मूल्य कम था। यह अंतर कैशिंग के कारण आया: Sonnet के कम कैश-रीड मूल्य ने इसे पुन: उपयोग किए गए संदर्भ वाले एजेंट वर्कलोड में बड़ा लाभ दिया। कार्य की कठिनाई अक्सर रूटिंग के समय अदृश्य होती है, और राउटर को एक साथ लागत, गुणवत्ता, विलंबता, अनुपालन और विश्वसनीयता को संतुलित करना होता है। विलंबता केवल मॉडल आकार पर नहीं, बल्कि हार्डवेयर और कैश स्थिति जैसे बुनियादी ढांचे के कारकों पर निर्भर करती है। लेखकों ने एक राउटर बनाया जो रूटिंग को वर्गीकरण नहीं बल्कि एक अनुकूलन समस्या मानता है, जो लागत-सटीकता सीमा तैयार करता है। कॉन्फ़िगरेशन 1 ने $93 और 83 सेकंड में 84% सटीकता प्राप्त की, जो अकेले Opus चलाने की तुलना में लागत में 21% और विलंबता में 9% की कमी थी, जिसमें केवल 4% सटीकता में गिरावट थी। एक मानक कठिनाई-आधारित राउटर (टील डायमंड) की सटीकता समान थी लेकिन लागत अधिक थी। अनुकूलन हल्का है: प्रति कार्य लगभग 6 मिलीसेकंड और 2 किलोबाइट मेमोरी।
स्रोत: Hugging Face blog —
मूल
