अध्ययन एंथ्रोपिक और OpenAI का खंडन करता है: स्वायत्त एआई अनुसंधान अभी दूर है
Anthropic
OpenAI
Sakana AI
Google DeepMind
प्रिंसटन और यूके एआई सुरक्षा संस्थान की भागीदारी वाला एक नया अध्ययन पाता है कि वर्तमान सीमावर्ती एआई मॉडल स्वतंत्र एआई अनुसंधान में विफल रहते हैं, एंथ्रोपिक और OpenAI जैसी प्रमुख प्रयोगशालाओं के दावों के बावजूद। अप्रकाशित NeurIPS पेपरों के साथ 'शैडो इवैल्यूएशन' विधि का उपयोग करते हुए, मानव लेखकों ने सभी एआई-जनित कार्यों को अस्वीकार कर दिया। एजेंट वैज्ञानिक निर्णय, रचनात्मक समस्या-समाधान और संसाधन प्रबंधन में संघर्ष करते रहे।
प्रिंसटन और यूके एआई सुरक्षा संस्थान के शोधकर्ताओं ने यह अनुभवजन्य रूप से परीक्षण करने के लिए एक अध्ययन किया कि क्या एआई एजेंट स्वतंत्र एआई शोध कर सकते हैं। उन्होंने 'शैडो इवैल्यूएशन' नामक एक विधि का उपयोग किया, जिसमें एआई एजेंटों को अप्रकाशित पेपरों से केंद्रीय शोध प्रश्न दिए गए, और मूल मानव लेखकों ने सम्मेलन समीक्षकों की तरह परिणामों का मूल्यांकन किया। एजेंटों ने क्लॉड ओपस 4.8 का उपयोग अतिरिक्त-उच्च तर्क के साथ किया, छह दिनों के लिए $3,000 एपीआई बजट, जीपीयू एक्सेस और वेब एक्सेस के साथ, ओपनक्लॉ एजेंट फ्रेमवर्क के भीतर काम किया। मूल लेखकों ने दोनों एआई-जनित पेपरों को अस्वीकार कर दिया, एक को 'स्ट्रॉन्ग रिजेक्ट' के साथ, खराब प्रेरित डेटा, अपठनीय गद्य और नवीन योगदान की कमी का हवाला देते हुए। विश्लेषण ने पांच व्यवस्थित कमजोरियों की पहचान की: प्रकाशन योग्य शोध गुणवत्ता के लिए निर्णय की कमी, रचनात्मक समस्या-समाधान में विफलता (एजेंटों ने नई परिकल्पनाएं उत्पन्न करने के बजाय दावों को संकुचित कर दिया), अप्रभावी बैकट्रैकिंग (महत्वाकांक्षी लक्ष्यों को समय से पहले छोड़ देना), संसाधन जागरूकता की कमी (एजेंटों ने अपने बजट के आधे से भी कम का उपयोग किया), और निर्देश विचलन (स्पष्ट निर्देशों को भूल जाना, लंबाई सीमा से अधिक होना)। इसके विपरीत, एजेंटों ने सभी इंजीनियरिंग कार्यों को सफलतापूर्वक संभाला, जिसमें साहित्य खोज, जीपीयू कोड डिबगिंग, सैकड़ों प्रयोग चलाना और लाटेक्स पेपर संकलित करना शामिल है। कोई महत्वपूर्ण रिवॉर्ड हैकिंग नहीं पाई गई। अपने परिणामों को सत्यापित करने के लिए, उन्होंने जीपीटी-5.6 सोल और ओपनएआई के कोडेक्स स्कैफोल्ड के साथ एक प्रयोग दोहराया, और लगभग समान विफलता मोड पाए। यह अध्ययन एंथ्रोपिक (जिन्होंने 'जब एआई खुद का निर्माण करता है' प्रकाशित किया) और ओपनएआई (जिन्होंने कहा कि जीपीटी-5.6 सोल ने पोस्ट-ट्रेनिंग में हफ्तों बचाए) के दावों का खंडन करता है। लेखकों ने नोट किया कि सिस्टम कार्ड इस योगदान का उल्लेख नहीं करता है। वे निष्कर्ष निकालते हैं कि फ्रंटियर मॉडल इंजीनियरिंग संभाल सकते हैं लेकिन सप्ताह भर के खुले शोध प्रश्नों में संघर्ष करते हैं। अध्ययन सहकर्मी समीक्षा प्रक्रिया की भी आलोचना करता है, साकाना एआई के एआई साइंटिस्ट-v2 पेपर का हवाला देते हुए जिसे एक कार्यशाला में स्वीकार किया गया था लेकिन बाद में उद्धरण त्रुटियों के कारण वापस ले लिया गया।
स्रोत: The Decoder (DE) —
मूल
