कुछ फ्रंटियर AI मॉडल्स को जेलब्रेक करना हैरान करने वाला आसान, रिपोर्ट में खुलासा
Anthropic
OpenAI
Google/DeepMind
FAR.AI की एक नई रिपोर्ट में खुलासा हुआ है कि कुछ अग्रणी AI मॉडल्स को बहुत कम लागत या प्रयास में जेलब्रेक किया जा सकता है। Grok सबसे कमजोर था, जबकि Claude और GPT परीक्षण किए गए हमलों से अप्रभावित रहे। ये निष्कर्ष बाहरी सुरक्षा नियमों की आवश्यकता को रेखांकित करते हैं।
FAR.AI, एक AI सुरक्षा गैर-लाभकारी संस्था, ने एक उपकरण बनाया जो फ्रंटियर AI मॉडल को जेलब्रेक करने के लिए हज़ारों प्रॉम्प्ट वेरिएशन उत्पन्न करता है। उन्होंने अमेरिकी कंपनियों के मॉडल का परीक्षण किया: एंथ्रोपिक का क्लॉड ओपस 4.8 और फेबल 5; OpenAI का GPT 5.5 और 5.6; गूगल का जेमिनी 3.1 प्रो; और SpaceXAI का ग्रोक 4.3 और 4.5। रिपोर्ट में ग्रोक के लिए 448, जेमिनी के लिए 249 जेलब्रेक पाए गए, और क्लॉड, फेबल या GPT के लिए कोई नहीं। ग्रोक को जेलब्रेक करने की लागत 58 डॉलर और जेमिनी की 278 डॉलर थी। FAR.AI के मुख्य कार्यकारी अधिकारी एडम ग्लीव ने अनिवार्य सुरक्षा मानकों की मांग की, यह देखते हुए कि स्वैच्छिक प्रतिबद्धताएं अपर्याप्त हैं। गूगल डीपमाइंड के रोहिन शाह ने तर्क दिया कि परिणाम एक व्यापक सुरक्षा मूल्यांकन नहीं हैं। एंथ्रोपिक और गूगल ने निरंतर सुधारों पर जोर दिया। कैलिफोर्निया, न्यूयॉर्क और इलिनॉय ने सुरक्षा रिपोर्ट या तृतीय-पक्ष ऑडिट की आवश्यकता वाले कानून पारित किए हैं, लेकिन कोई संघीय आवश्यकताएं नहीं हैं। व्हाइट हाउस ने कुछ मॉडल रिलीज़ पर देरी का अनुरोध किया है। विशेषज्ञ साइबर, जैव या रासायनिक क्षेत्रों में दुरुपयोग की संभावना के बारे में चेतावनी देते हैं।
स्रोत: Wired AI —
मूल
