AI सुरक्षाशोध 🇺🇸 27.07.2026 02:04

GPT-Red: स्वचालित रेड टीमिंग से OpenAI का आत्म-सुधार करने वाला AI सुरक्षा सिस्टम

OpenAIOpenAI
OpenAI ने GPT-Red पेश किया, एक स्वचालित रेड टीमिंग सिस्टम जो सेल्फ-प्ले विधि का उपयोग करके बड़े भाषा मॉडलों की सुरक्षा, संरेखण और प्रॉम्प्ट इंजेक्शन के प्रति मजबूती को बढ़ाता है। यह सिस्टम मॉडल को स्वायत्त रूप से हमले के परिदृश्य उत्पन्न करने और उन पर फाइन-ट्यून करने की अनुमति देता है, जिससे निरंतर मानव हस्तक्षेप के बिना इसकी मजबूती में सुधार होता है।
OpenAI ने GPT-Red का अनावरण किया है, जो एक स्वचालित रेड टीमिंग सिस्टम है जिसे कृत्रिम बुद्धिमत्ता की सुरक्षा, संरेखण और मजबूती को बढ़ाने के लिए डिज़ाइन किया गया है। यह सिस्टम एक सेल्फ-प्ले लर्निंग विधि का उपयोग करता है, जहां मॉडल स्वायत्त रूप से अटैक प्रॉम्प्ट और दुर्भावनापूर्ण परिदृश्य उत्पन्न करता है, फिर अपनी सुरक्षा में सुधार करने के लिए उन पर स्वयं को फ़ाइन-ट्यून करता है। यह दृष्टिकोण मानव परीक्षकों को लगातार शामिल किए बिना मॉडल की मजबूती में निरंतर वृद्धि को सक्षम बनाता है। GPT-Red विशेष रूप से प्रॉम्प्ट इंजेक्शन के लिए कमजोरियों का पता लगाने और उन्हें कम करने में प्रभावी है, जहां एक हमलावर विशेष रूप से तैयार क्वेरी का उपयोग करके मॉडल की सीमाओं को बायपास करने का प्रयास करता है। सिस्टम स्वचालित रूप से हमलों के परिणामों का मूल्यांकन करता है और मॉडल के व्यवहार को समायोजित करने के लिए उनका उपयोग करता है, जिससे सुरक्षा सुधार प्रक्रिया अधिक स्केलेबल और कुशल बन जाती है।
स्रोत: OpenAI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार