GPT-5.6 खुद को ऑप्टिमाइज़ कर रहा है, एक नया बूटस्ट्रैप दृष्टिकोण सामने आया है

OpenAIOpenAI
OpenAI की तकनीकी रिपोर्ट से पता चलता है कि GPT-5.6 अब प्रोडक्शन में अपने रनटाइम वातावरण को ऑप्टिमाइज़ करने के लिए लागू किया गया है, जिसमें ट्रैफिक का विश्लेषण करना, अनुरोध रूटिंग को समायोजित करना, निम्न-स्तरीय कर्नेल को फिर से लिखना और स्पेकुलेटिव डिकोडिंग को ऑप्टिमाइज़ करना शामिल है। इन सुधारों ने एंड-टू-एंड सेवा लागत को 20% कम किया और टोकन उत्पादन दक्षता को 15% से अधिक बढ़ाया। इस बीच, मानव निगरानी बनी हुई है, और ऑप्टिमाइज़ेशन लक्ष्यों और डिप्लॉयमेंट निर्णयों को लोगों द्वारा नियंत्रित किया जाता है।
OpenAI ने GPT-5.6 पर लागू RSI (रिकर्सिव सेल्फ-इम्प्रूवमेंट) का विवरण देते हुए एक तकनीकी रिपोर्ट प्रकाशित की। मॉडल अब उत्पादन में तैनात है: यह ट्रैफ़िक का विश्लेषण करता है, रूटिंग को समायोजित करता है, ट्राइटन और ग्लूऑन कर्नेल को फिर से लिखता है, सैकड़ों प्रयोग चलाकर अपनी स्वयं की स्पेक्युलेटिव डिकोडिंग प्रणाली को अनुकूलित करता है, और इष्टतम तैनाती पैरामीटर (बैचिंग, शार्डिंग, केवी कैश प्रबंधन) की खोज करता है। परिणामस्वरूप, OpenAI की एंड-टू-एंड सेवा लागत में 20% की गिरावट आई और टोकन उत्पादन दक्षता में 15% से अधिक सुधार हुआ। उल्लेखनीय लेखकों में ट्राइटन के निर्माता फिलिप टिले शामिल हैं। हालाँकि, मानवीय निगरानी बनी हुई है: मानव अनुकूलन लक्ष्य, टूल अनुमतियाँ, मूल्यांकन मीट्रिक और अंतिम तैनाती निर्णय निर्धारित करते हैं। इसके अतिरिक्त, OpenAI ने एजेंट लूप में आवर्ती ओवरहेड को कम करने के लिए रस्ट-आधारित एजेंट हार्नेस बनाया, जिसमें आलसी टूल डिस्कवरी (जरूरत पड़ने पर ही टूल दिखाना) और संदर्भ पुन: उपयोग को संरक्षित करने के लिए एपेंड-ओनली प्रॉम्प्ट कैशिंग जैसे अनुकूलन शामिल हैं। GPT-5.6 के आंतरिक परीक्षण के दौरान, प्रति सक्रिय शोधकर्ता दैनिक टोकन आउटपुट GPT-5.5 के शिखर की तुलना में दोगुना हो गया; आंतरिक प्रोग्रामिंग तर्क के लिए शोध कंप्यूट छह महीनों में 100 गुना बढ़ गया, और आंतरिक एजेंट टोकन उपयोग लगभग 22 गुना बढ़ गया।
स्रोत: QbitAI 量子位 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार