AI सुरक्षाशोध 🇩🇪 13.08.2026 13:02

एआई शोधकर्ताओं ने आत्म-सुधार की चेतावनी दी थी और अब पहले मील के पत्थर हासिल हुए देख रहे हैं

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind Sakana AISakana AI
IAPS फेलो सेवेरिन फील्ड ने OpenAI, Anthropic, Google DeepMind, Meta, और अमेरिकी विश्वविद्यालयों के 25 शोधकर्ताओं का सर्वेक्षण किया, जिसमें पुनरावर्ती आत्म-सुधार (आरएसआई) पर चर्चा की गई। एक ब्लॉग पोस्ट में, उन्होंने रिपोर्ट दी कि उनके द्वारा सूचीबद्ध कई मील के पत्थर अब हासिल कर लिए गए हैं, जैसे कि गणित ओलंपियाड में स्वर्ण-स्तरीय प्रदर्शन और एआई-जनित कार्यशाला पेपर। फील्ड ने एक 'प्रोत्साहन फ्लिप' की भी चेतावनी दी जो शक्तिशाली मॉडलों को आंतरिक रखने की ओर ले जा सकता है।
न्यूज़लेटर द अटैक सर्फेस के लिए एक ब्लॉग पोस्ट में, सेवेरिन फील्ड ने 2025 की गर्मियों के अंत में किए गए एक साक्षात्कार अध्ययन के परिणामों का सारांश दिया है। साक्षात्कार किए गए 25 शोधकर्ताओं में से 20 ने एआई अनुसंधान के स्वचालन को सबसे गंभीर और तत्काल एआई जोखिमों में से एक बताया। पुनरावर्ती आत्म-सुधार (आरएसआई) एक ऐसी प्रणाली को संदर्भित करता है जो एआई विकास में इतनी अच्छी है कि वह खुद का एक मजबूत संस्करण बना सके, एक चक्र जो जारी रह सकता है। फील्ड का तर्क है कि आरएसआई अब केवल एक विपणन वादा नहीं है। प्रगति के माप के रूप में, साक्षात्कारकर्ताओं ने बार-बार गैर-लाभकारी METR द्वारा टास्क होराइजन बेंचमार्क का उल्लेख किया, जो दर्शाता है कि एआई एजेंट स्वायत्त रूप से पूरा कर सकने वाले कार्यों की लंबाई 2019 से लगभग हर छह महीने में दोगुनी हो जाती है (कुछ विश्लेषकों का दावा है कि 2024 से हर चार महीने में)। विवादित बिंदु स्वयं आत्म-सुधार नहीं है, बल्कि इसकी पुनरावर्तीता है - क्या सुधार एक आत्मनिर्भर लूप में बदल जाएंगे। संशयवादियों का कहना है कि स्मृति, रचनात्मकता, या सत्य और असत्य परिकल्पनाओं को अलग करने में एक सफलता की आवश्यकता है, क्योंकि प्रतिमान-परिवर्तनकारी विचारों के लिए कोई प्रशिक्षण डेटा या समाधान कुंजी नहीं है। साक्षात्कार के बाद से, कई मील के पत्थर हासिल किए गए हैं: ओपनएआई और गूगल डीपमाइंड ने गणित ओलंपियाड में स्वर्ण-स्तरीय प्रदर्शन हासिल किया, सकाना के 'एआई वैज्ञानिक' ने एक सहकर्मी-समीक्षित कार्यशाला पेपर तैयार किया, आंद्रेज कार्पैथी ने एक एजेंट सेटअप बनाया जो स्वतंत्र रूप से प्रशिक्षण चक्र चलाता है, और एंथ्रोपिक ने बताया कि उसका क्लॉड मॉडल अब अपने स्वयं के उत्पादन कोडबेस के लिए 80% से अधिक कोड लिखता है। 20 उत्तरदाताओं में से केवल चार को उम्मीद है कि अनुसंधान-क्षमता वाले मॉडल सार्वजनिक उत्पादों के रूप में दिखाई देंगे; आधे को विशुद्ध रूप से आंतरिक उपयोग की उम्मीद है, और बाकी को आसुत सार्वजनिक संस्करणों की उम्मीद है। फील्ड एक संभावित 'प्रोत्साहन परिवर्तन' का वर्णन करते हैं: एक बार जब एआई अपने स्वयं के अनुसंधान को उल्लेखनीय रूप से तेज कर देता है, तो उसे रोकना बेचने से अधिक मूल्यवान हो जाता है। सबूत के रूप में, वह जुलाई 2026 में एक आंतरिक ओपनएआई मॉडल के साथ एक सुरक्षा घटना का उल्लेख करते हैं जो अपने परीक्षण वातावरण से बच निकला और हगिंग फेस से समझौता किया, और अमेरिकी सरकार के एंथ्रोपिक के क्लॉड माइथोस तक अस्थायी पहुंच प्रतिबंध का उल्लेख करते हैं। फील्ड तीन सिफारिशें प्राप्त करते हैं: सुनवाई जो सीईओ और शोधकर्ताओं से स्वचालित एआई अनुसंधान के बारे में शपथ के तहत पूछताछ करती है, एआई सुरक्षा और नवाचार केंद्र में एक राज्य-संचालित टास्क होराइजन बेंचमार्क के साथ एक गुमनाम साक्षात्कार कार्यक्रम, और अंतरराष्ट्रीय एआई समझौतों के सत्यापन पर अनुसंधान, जिसके बिना चीन के साथ सौदे व्यावहारिक रूप से लागू करने योग्य नहीं होंगे। वे ध्यान देते हैं कि बहस मुश्किल से वाशिंगटन तक पहुंची है जबकि प्रयोगशालाएं आगे बढ़ती जा रही हैं। हाल ही में, ओपनएआई और मेटा के मुख्य वैज्ञानिकों सहित प्रमुख एआई कंपनियों के 1,224 कर्मचारियों ने एक खुले बयान पर हस्ताक्षर किए, जिसमें चेतावनी दी गई कि उनकी कंपनियां जल्द ही एआई अनुसंधान को स्वचालित कर सकती हैं।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार