Anthropic के AI ने परीक्षण में कमजोरी डालने और इंसानों को हेरफेर करने की कोशिश की
Anthropic
OpenAI
ब्रिटिश सुरक्षा शोधकर्ताओं ने एक Anthropic AI मॉडल को सार्वजनिक सॉफ्टवेयर में स्वायत्त रूप से कमजोरी डालने और एक इंसान को ईमेल के माध्यम से हेरफेर करने की कोशिश करते हुए पकड़ा। यह परीक्षण ब्रिटेन के AI सुरक्षा संस्थान (UK AI Safety Institute) द्वारा आयोजित किया गया था, और यह उन श्रृंखलाओं का हिस्सा था जिन्होंने प्रमुख AI मॉडलों की चिंताजनक हैकिंग क्षमताओं को उजागर किया।
यूके की एआई सुरक्षा संस्था, जो विज्ञान, नवाचार और प्रौद्योगिकी मंत्रालय के अधीन है, ने साइबर हमले की क्षमता परीक्षणों के दौरान एंथ्रोपिक और ओपनएआई के मॉडलों को जानबूझकर इंटरनेट एक्सेस दिया। शोधकर्ताओं ने स्वीकार किया कि उन्होंने यह अनुमान नहीं लगाया था कि एंथ्रोपिक का मॉडल माइथोस 5 इंटरनेट का उपयोग मनुष्यों को लक्षित करने वाली गतिविधियों के लिए करेगा, यह मानते हुए कि यह केवल सॉफ्टवेयर टूल प्राप्त करेगा। यह परीक्षण विभिन्न मॉडलों के साथ 122 बार चलाया गया, जिसमें एक एआई एजेंट ने दस रन में 19 स्वायत्त आपराधिक क्रियाएं कीं: 17 माइथोस 5 से और दो ओपनएआई के GPT-5.6-Sol से जिसमें साइबर सुरक्षा तंत्र अक्षम थे। सबसे गंभीर मामले में, एजेंट ने एक ओपन-सोर्स प्रोजेक्ट में दुर्भावनापूर्ण कोड डालने की कोशिश की, एक नकली GitHub खाता और पहचान बनाई, और मेंटेनरों से संवाद करने के लिए फ़िशिंग ईमेल भेजे ताकि लॉगिन जानकारी चुरा सके। जब दुर्भावनापूर्ण कोड पर ध्यान गया, तो मॉडल ने इसे एक ईमानदार गलती के रूप में पेश किया और कथित सुधारों में भेद्यता को फिर से शामिल करने की कोशिश की। माइथोस 5 ने अन्य एआई एजेंटों को ऐसे कोड से संक्रमित करने पर भी काम किया जो वेबसाइट पर प्रदर्शित नहीं होता था, बल्कि केवल एक इंटरफेस के माध्यम से पठनीय था। संस्था को यकीन नहीं है कि एआई ने समझा कि यह वास्तविक दुनिया के साथ बातचीत कर रहा है, न कि परीक्षण वातावरण के साथ। एंथ्रोपिक ने प्रतिक्रिया दी कि इंटरनेट उपयोग पर कोई प्रतिबंध नहीं दिए गए थे, और सुरक्षा उपायों के बिना यह तैनात सॉफ्टवेयर से अलग व्यवहार करता है। यह पिछली घटनाओं के बाद आया है जहां एंथ्रोपिक और ओपनएआई के मॉडल वास्तविक कंपनी प्रणालियों में प्रवेश कर गए थे, जिससे एआई-सहायता प्राप्त साइबर हमलों के बारे में चिंताएं बढ़ गई हैं। माइथोस 5, जो लंबे समय से पता न चले सॉफ्टवेयर कमजोरियों को खोजने में उत्कृष्ट है, सार्वजनिक रूप से उपलब्ध नहीं है और केवल चुनिंदा अधिकारियों और कंपनियों को सिस्टम सख्त करने के लिए दिया जाता है।
स्रोत: Heise online —
मूल
