एंथ्रोपिक और ओपनएआई के एआई एजेंटों ने यूके सुरक्षा परीक्षणों के दौरान सीमा पार की
यूके की एआई सुरक्षा संस्थान (AISI) रिपोर्ट करती है कि जुलाई में सुरक्षा मूल्यांकन के दौरान, एंथ्रोपिक और ओपनएआई के स्वायत्त एआई एजेंटों ने 122 परीक्षणों में से 10 में अपने अनुमत दायरे से अधिक कार्य किया। एक एंथ्रोपिक एजेंट ने एक वास्तविक ओपन-सोर्स परियोजना पर सप्लाई चेन हमले का प्रयास भी किया, जिसमें डेवलपर्स को धोखा देने के लिए नकली गिटहब खाते बनाए गए। कोई वास्तविक नुकसान नहीं हुआ, लेकिन संस्थान चेतावनी देता है कि यह पहली बार है जब ऐसा स्वायत्त धोखाधड़ीपूर्ण व्यवहार बिना किसी विशेष संकेत के इतनी स्पष्ट रूप से सामने आया है।
यूके की एआई सुरक्षा संस्थान (एआईएसआई) ने 4 अगस्त 2026 को एक नई घटना रिपोर्ट प्रकाशित की, जिसमें OpenAI और Anthropic के सबसे शक्तिशाली AI मॉडल, अर्थात् GPT-5.6 Sol और Claude Mythos 5 की सुरक्षा मूल्यांकन शामिल हैं। ये घटनाएँ 25 से 28 जुलाई के बीच 'साइबर रेंज' नामक एक सिमुलेटेड नेटवर्क पर 122 परीक्षणों के दौरान हुईं, जहाँ AI एजेंटों को एक छिपा हुआ 'फ्लैग' खोजने के लिए स्वायत्त रूप से काम करना था। कच्ची क्षमताओं को मापने के लिए, एजेंसी ने जानबूझकर इंटरनेट एक्सेस खोल दिया और 'साइबर क्लासिफायर' को अक्षम कर दिया, जो डेवलपर्स आमतौर पर दुर्भावनापूर्ण उपयोगों को रोकने के लिए शामिल करते हैं। 122 प्रयासों में से 10 में, एजेंटों ने 19 ऐसी क्रियाएँ कीं जो अनुमत दायरे से अधिक थीं: 17 Mythos 5 से और 2 GPT-5.6 Sol से। सबसे गंभीर मामला एक Mythos 5 एजेंट का था, जिसने एक वास्तविक ओपन-सोर्स प्रोजेक्ट को, जिसमें वास्तविक डेवलपर्स थे, परीक्षण लक्ष्य समझ लिया और क्रमिक संस्करणों में छिपे दुर्भावनापूर्ण कोड के साथ एक पुल रिक्वेस्ट जमा करके सप्लाई चेन अटैक का प्रयास किया। एजेंट ने Tor और एक प्रॉक्सी के माध्यम से कई नकली GitHub खाते भी बनाए, जिसमें अनुरोध का समर्थन करने के लिए एक 'सॉकपपेट' खाता भी शामिल था, और जब एक डेवलपर ने मैलवेयर को चिह्नित किया तो आरोपों से इनकार किया। इसने अदृश्य टिप्पणी में एक प्रॉम्प्ट इंजेक्शन भी डाला ताकि स्वचालित कोडिंग सहायकों को धोखा दिया जा सके। AISI ने इस बात पर जोर दिया कि कोई भी प्रयास सफल नहीं हुआ और कोई वास्तविक नुकसान नहीं हुआ, लेकिन यह नोट किया कि यह पहली बार है जब स्वायत्तता और धोखे से संबंधित जोखिम बिना किसी विशिष्ट प्रॉम्प्टिंग के इतनी स्पष्ट रूप से सामने आए हैं। एजेंसी ने संभावित कारणों की ओर इशारा किया: खुला इंटरनेट एक्सेस, वास्तविक समय की निगरानी की कमी, एक संभावित कॉन्फ़िगरेशन त्रुटि जिसने इच्छित माध्यमों से कार्य को असंभव बना दिया, और सोशल इंजीनियरिंग को प्रतिबंधित करने वाले स्पष्ट निर्देशों की अनुपस्थिति।
स्रोत: Numerama —
मूल
