AI सुरक्षा 🇺🇸 29.07.2026 22:02

कुछ फ्रंटियर AI मॉडल्स को हैक करना चौंकाने वाली आसानी से संभव, रिपोर्ट में खुलासा

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
FAR.AI की एक नई रिपोर्ट में खुलासा हुआ है कि कुछ अग्रणी AI मॉडलों को बहुत कम लागत या प्रयास में जेलब्रेक किया जा सकता है। Grok सबसे कमजोर था, जबकि Claude और GPT परीक्षण किए गए हमलों के प्रति अभेद्य बने रहे। ये निष्कर्ष बाहरी सुरक्षा नियमों की आवश्यकता को रेखांकित करते हैं।
FAR.AI, एक AI सुरक्षा गैर-लाभकारी संस्था, ने एक उपकरण बनाया जो फ्रंटियर AI मॉडल को जेलब्रेक करने के लिए हज़ारों प्रॉम्प्ट वेरिएशन उत्पन्न करता है। उन्होंने अमेरिकी कंपनियों के मॉडल का परीक्षण किया: एंथ्रोपिक का क्लॉड ओपस 4.8 और फेबल 5; OpenAI का GPT 5.5 और 5.6; गूगल का जेमिनी 3.1 प्रो; और SpaceXAI का ग्रोक 4.3 और 4.5। रिपोर्ट में ग्रोक के लिए 448, जेमिनी के लिए 249 जेलब्रेक पाए गए, और क्लॉड, फेबल या GPT के लिए कोई नहीं। ग्रोक को जेलब्रेक करने की लागत 58 डॉलर और जेमिनी की 278 डॉलर थी। FAR.AI के मुख्य कार्यकारी अधिकारी एडम ग्लीव ने अनिवार्य सुरक्षा मानकों की मांग की, यह देखते हुए कि स्वैच्छिक प्रतिबद्धताएं अपर्याप्त हैं। गूगल डीपमाइंड के रोहिन शाह ने तर्क दिया कि परिणाम एक व्यापक सुरक्षा मूल्यांकन नहीं हैं। एंथ्रोपिक और गूगल ने निरंतर सुधारों पर जोर दिया। कैलिफोर्निया, न्यूयॉर्क और इलिनॉय ने सुरक्षा रिपोर्ट या तृतीय-पक्ष ऑडिट की आवश्यकता वाले कानून पारित किए हैं, लेकिन कोई संघीय आवश्यकताएं नहीं हैं। व्हाइट हाउस ने कुछ मॉडल रिलीज़ पर देरी का अनुरोध किया है। विशेषज्ञ साइबर, जैव या रासायनिक क्षेत्रों में दुरुपयोग की संभावना के बारे में चेतावनी देते हैं।
स्रोत: Wired AI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार