जब प्रश्न बैंक साथ नहीं दे पाते, तो एआई खुद अपनी समस्याएं तय करने लगता है: एंडलेस फ्रंटियर टीम डेटा-स्तरीय आरएसआई से गुजरती है
DP Technology
DeepSeek
शंघाई जिओ टोंग विश्वविद्यालय, डीपी टेक्नोलॉजी और शंघाई इंस्टीट्यूट ऑफ एल्गोरिदम इनोवेशन की एक चीनी टीम ने बिगबैंग-वी1 जारी किया है, जो पुनरावर्ती स्व-सुधार (रीकर्सिव सेल्फ-इम्प्रूवमेंट) का उपयोग करके मूल रूप से प्रशिक्षित पहला बेस मॉडल है। 35 बिलियन पैरामीटर वाला यह मॉडल, जो 100 प्रतिशत एआई-संश्लेषित प्रशिक्षण डेटा पर आधारित है, कई वैज्ञानिक बेंचमार्कों पर ट्रिलियन-पैरामीटर मॉडलों से बेहतर प्रदर्शन करता है, जो एक स्व-विकसित होने वाली डेटा पाइपलाइन को दर्शाता है।
एंडलेस फ्रंटियर टीम, जो शंघाई जियाओतोंग विश्वविद्यालय के एआई संस्थान, डीपी टेक्नोलॉजी और शंघाई इंस्टीट्यूट ऑफ एल्गोरिदम इनोवेशन के शोधकर्ताओं से बनी है, ने बिगबैंग-वी1 लॉन्च किया है, जो पुनरावर्ती स्व-सुधार (आरएसआई) का उपयोग करके मूल रूप से प्रशिक्षित पहला बेस मॉडल है। इस दृष्टिकोण में, एआई समस्या निर्माण, समाधान और सत्यापन को संभालता है, जिससे प्रति कार्य मानवीय भागीदारी के बिना उच्च-गुणवत्ता वाला स्व-विकसित सिंथेटिक डेटा तैयार होता है। 35 अरब पैरामीटर वाला और अनुमान के दौरान लगभग 3 अरब सक्रिय पैरामीटर वाला यह मॉडल 262 हजार लंबे संदर्भ का समर्थन करता है और पूरी तरह से सीमांत विज्ञान कार्यों पर केंद्रित एआई-संश्लेषित डेटा पर प्रशिक्षित है। इसने लंबे क्षितिज वाले खोज, कोडिंग, वैज्ञानिक अनुसंधान और एआई अनुसंधान सहित बेंचमार्क में 35 अरब पैरामीटर मॉडलों के बीच 10 प्रथम स्थान प्राप्त किए, और यहां तक कि फ्रंटियरसाइंस रिसर्च और पेपरबेंच जैसे कठिन वैज्ञानिक कार्यों में 1 खरब पैरामीटर वाले डीपसीक वी4 प्रो प्रीव्यू से भी आगे निकल गया। इसकी क्षमता के उदाहरणों में जंक्शन साक्ष्य का उपयोग करके ट्रांसपोसॉन सम्मिलन स्थल का सटीक पता लगाना और स्मोक टेस्ट के दौरान स्व-सुधार करके एक पेपर को चलाने योग्य कोड में दोहराना शामिल है। टीम इस बात पर जोर देती है कि डेटा उत्पादन प्रणाली को स्वयं अनुकूलित किया जा सकता है, जिसके लिए ऐसे कार्यों की आवश्यकता होती है जो सीमांत और सत्यापन योग्य दोनों हों, और वे एक दोहरी-लूप पाइपलाइन लागू करते हैं: जनरेटर और आलोचक एजेंटों के साथ एक आंतरिक लूप जो डेटा का उत्पादन और जांच करते हैं, और एक बाहरी लूप जो सिस्टम को कैलिब्रेट करने के लिए वास्तविक प्रशिक्षण परिणामों द्वारा संचालित होता है। यह डेटा-स्तरीय आरएसआई लूप सिंथेटिक डेटा पतन को रोकता है, जबकि मानव अभी भी लक्ष्य, बजट, जोखिम और स्वीकृति मानदंड परिभाषित करते हैं। मॉडल और कोड हगिंग फेस और गिटहब पर ओपन-सोर्स किए गए हैं।
स्रोत: QbitAI 量子位 —
मूल
