OpenAI फील्ड रिपोर्ट: AI एजेंट नाजुक रिसर्च सॉफ्टवेयर को फिर से लिखते हैं, लेकिन शोधकर्ताओं को सख्ती से सत्यापित करना चाहिए
OpenAI
Anthropic
OpenAI और शैक्षणिक साझेदारों ने पाया कि AI कोडिंग एजेंट पुराने रिसर्च सॉफ्टवेयर को गति दे सकते हैं और बनाए रख सकते हैं, लेकिन बोझ प्रोग्रामिंग से सत्यापन पर स्थानांतरित हो जाता है। आठ केस स्टडीज़ में, एजेंटों ने उपकरणों को आधुनिक बनाया, कुछ 60 गुना तेज़ चल रहे हैं, फिर भी वे अक्सर गलत कोड उत्पन्न करते हुए आत्मविश्वास से व्यवहार करते थे। शोधकर्ता स्वतंत्र सत्यापन और वैज्ञानिक निरीक्षण की आवश्यकता पर जोर देते हैं।
OpenAI और शैक्षणिक सहयोगियों की एक फील्ड रिपोर्ट में आठ केस स्टडीज़ का दस्तावेजीकरण किया गया है, जिनमें ज्यादातर जीवविज्ञान से संबंधित हैं, जहां कोडिंग एजेंटों जैसे कि Codex और Claude Code का उपयोग शोध सॉफ्टवेयर को बनाए रखने, अनुकूलित करने या फिर से लिखने के लिए किया गया। परियोजनाएं साधारण रखरखाव से लेकर आधुनिक भाषाओं में पूर्ण पुनर्लेखन तक भिन्न थीं। उदाहरण के लिए, GPT-5.5 ने Python लाइब्रेरी cyvcf2 के लिए बिल्ड प्रक्रिया को आधुनिक बनाया, जबकि दो एजेंटों, Claude Code और Codex ने MHCflurry की लगभग 10,000 पंक्तियों को TensorFlow से PyTorch में स्थानांतरित किया। rustar-aligner परियोजना ने STAR, एक बहु-हज़ार पंक्ति वाले C/C++ टूल, को Rust में फिर से लिखा, जिससे परीक्षण डेटासेट पर मूल के साथ 99.815% और 99.883% सहमति प्राप्त हुई। RustQC, जिसमें 15 गुणवत्ता-नियंत्रण उपकरण शामिल थे, ने रनटाइम को 15 घंटे 34 मिनट से घटाकर 14 मिनट 54 सेकंड कर दिया—जो 60 गुना से अधिक का कारक है। HelixForge, BamSurgeon का एक विकल्प, समग्र रूप से 59.6 गुना तेज था, जिसमें मुख्य गणना 98.6 गुना तेज थी। हालाँकि, एजेंट अक्सर आत्मविश्वासी दिखते थे लेकिन गलत थे; उदाहरण के लिए, bayesm पुनर्लेखन में, दो प्रक्रियाओं में सूक्ष्म त्रुटियां थीं, जिनमें एक उलटा नियंत्रण पैरामीटर और एक दोषपूर्ण स्केलिंग कारक शामिल था। शोधकर्ताओं ने निष्कर्ष निकाला कि मनुष्यों को लक्ष्य, सफलता मानदंड और सत्यापन विधियों को परिभाषित करना चाहिए, जबकि एजेंट कार्यान्वयन संभालते हैं। रिपोर्ट महत्वपूर्ण समय की बचत का अनुमान लगाती है—उदाहरण के लिए, NumPy के रखरखाव से प्रति वर्ष लगभग 650 घंटे बच सकते हैं—लेकिन दीर्घकालिक रखरखाव और जिम्मेदारी को मुख्य चुनौतियों के रूप में उजागर करती है। कुछ परिवर्तन ऊपर की ओर विलय कर दिए गए, जबकि अन्य, जैसे FastQC, मूल लेखक द्वारा अस्वीकार कर दिए गए, जिससे सुधारों को मूल Java संस्करण में शामिल किया गया। रिपोर्ट पूर्वव्यापी है और स्व-रिपोर्ट पर आधारित है, और यह नोट करती है कि बाधा कार्यान्वयन से सत्यापन और वैज्ञानिक समीक्षा की ओर स्थानांतरित हो रही है। यह पैटर्न एक METR अध्ययन और डेवलपर टीमों की AI कोड से निराशा पर एक अध्ययन से प्रतिध्वनित होता है। रिपोर्ट OpenAI की व्यापक विज्ञान रणनीति के अनुरूप है, जिसमें Kevin Weil के नेतृत्व में एक समर्पित टीम और GPT-Rosalind की रिलीज़ शामिल है।
स्रोत: The Decoder (DE) —
मूल
