StruQ और SecAlign: प्रॉम्प्ट इंजेक्शन हमलों से बचाव
Meta
OpenAI
BAIR के शोधकर्ताओं ने LLM-एकीकृत अनुप्रयोगों में प्रॉम्प्ट इंजेक्शन हमलों के खिलाफ दो फाइन-ट्यूनिंग रक्षा विधियाँ, StruQ और SecAlign, प्रस्तावित की हैं। StruQ संरचित निर्देश ट्यूनिंग का उपयोग करके इंजेक्ट किए गए निर्देशों को अनदेखा करता है, जबकि SecAlign प्राथमिकता अनुकूलन लागू करता है जिससे बेहतर मजबूती मिलती है, और अनुकूलन-मुक्त हमलों के लिए हमले की सफलता दर लगभग 0% तक और अनुकूलन-आधारित हमलों के लिए 15% से नीचे कम हो जाती है।
प्रॉम्प्ट इंजेक्शन, जहां अविश्वसनीय डेटा में एक निर्देश होता है जो सिस्टम के इच्छित प्रॉम्प्ट को ओवरराइड करता है, OWASP द्वारा LLM-एकीकृत अनुप्रयोगों के लिए #1 खतरे के रूप में सूचीबद्ध किया गया है। Google Docs, Slack AI और ChatGPT जैसी उत्पादन-स्तर प्रणालियाँ कमजोर पाई गई हैं। लेखक दो कारण प्रस्तावित करते हैं: प्रॉम्प्ट और डेटा के बीच पृथक्करण का अभाव, और LLMs का इनपुट में कहीं भी निर्देशों का पालन करने के लिए प्रशिक्षित होना। इन्हें संबोधित करने के लिए, वे एक सुरक्षित फ्रंट-एंड प्रस्तुत करते हैं जो प्रॉम्प्ट और डेटा को सीमांकित करने के लिए विशेष टोकन का उपयोग करता है, डेटा में किसी भी डिलीमीटर को फ़िल्टर करता है। StruQ (स्ट्रक्चर्ड इंस्ट्रक्शन ट्यूनिंग) प्रशिक्षण के दौरान प्रॉम्प्ट इंजेक्शन का अनुकरण करता है, LLM को डेटा भाग में इंजेक्ट किए गए निर्देशों को अनदेखा करना सिखाता है। SecAlign (स्पेशल प्रेफरेंस ऑप्टिमाइज़ेशन) वांछनीय और अवांछनीय दोनों प्रतिक्रियाओं पर प्रशिक्षण देकर आगे बढ़ता है, उनके बीच एक बड़ा प्रायिकता अंतर बनाने के लिए प्रेफरेंस ऑप्टिमाइज़ेशन का उपयोग करता है। Llama3-8B-Instruct पर प्रयोगों से पता चलता है कि StruQ आक्रमण सफलता दर (ASR) को 45% तक कम कर देता है, और SecAlign इसे परिष्कृत आक्रमणों के विरुद्ध 8% तक कम कर देता है। SecAlign AlpacaEval2 द्वारा मापी गई उपयोगिता को बनाए रखता है, जबकि StruQ इसे 4.5% कम करता है। दोनों ऑप्टिमाइज़ेशन-मुक्त आक्रमणों की सफलता दर को लगभग 0% तक कम कर देते हैं, और SecAlign ऑप्टिमाइज़ेशन-आधारित आक्रमण ASR को पिछले सर्वोत्तम स्तर से 4 गुना से अधिक कम कर देता है।
स्रोत: BAIR (Berkeley AI) —
मूल
