AI सुरक्षामॉडल 🇷🇺 24.07.2026 11:01

प्रॉम्प्ट इंजेक्शन फिल्टर से ठीक नहीं होता: आर्किटेक्चरल पैटर्न का उपयोग करके अविश्वसनीय टेक्स्ट को कैसे अलग करें

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
प्रॉम्प्ट इंजेक्शन एलएलएम एप्लिकेशनों में एक संरचनात्मक दोष बना हुआ है, जो सिस्टम प्रॉम्प्ट या क्लासिफायर द्वारा ठीक नहीं किया जाता। आर्किटेक्चरल पैटर्न जैसे डुअल-एलएलएम, Google DeepMind से CaMeL, और मेटा से एजेंट्स रूल ऑफ टू मजबूत अलगाव प्रदान करते हैं। लेख में खतरे का मॉडल, Microsoft 365 Copilot में EchoLeak कमजोरी, और तीन पृथक मॉडलों के साथ एक ठोस कार्यान्वयन का विवरण दिया गया है।
प्रॉम्प्ट इंजेक्शन, जिसे सितंबर 2022 में साइमन विलिसन ने पेश किया था, तब होता है जब एलएलएम के कॉन्टेक्स्ट में अविश्वसनीय टेक्स्ट को एक निर्देश के रूप में निष्पादित किया जाता है। जेलब्रेकिंग के विपरीत, यह उन एप्लिकेशन को प्रभावित करता है जहां मॉडल के पास टूल और डेटा तक पहुंच होती है, जिससे कंफ्यूज्ड डेप्युटी और डेटा एक्सफ़िलट्रेशन हमले होते हैं। लेख का तर्क है कि सिस्टम प्रॉम्प्ट और गार्डरेल क्लासिफ़ायर अप्रभावी हैं, 2025 में ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड द्वारा किए गए एक अध्ययन का हवाला देते हुए जिसमें दिखाया गया कि अनुकूली हमलों ने 90% से अधिक सफलता दर के साथ 12 प्रकाशित बचावों को दरकिनार कर दिया। साइमन विलिसन का 'लेथल ट्राइफेक्टा' डेटा एक्सफ़िलट्रेशन के लिए तीन तत्वों की पहचान करता है: निजी डेटा तक पहुंच, अविश्वसनीय सामग्री के साथ संपर्क, और एक आउटबाउंड चैनल। माइक्रोसॉफ्ट 365 कोपायलट में इकोलीक भेद्यता (सीवीई-2025-32711) ने तीनों का शोषण किया। मेटा का 'एजेंट्स रूल ऑफ टू' कहता है कि एक एजेंट के पास तीन गुणों में से दो से अधिक नहीं होने चाहिए: अविश्वसनीय इनपुट प्रोसेस करना, संवेदनशील सिस्टम/डेटा तक पहुंच, और स्थिति बदलने या बाहरी रूप से संवाद करने की क्षमता। डुअल-एलएलएम (विलिसन, 2023) जैसी आर्किटेक्चर एक विशेषाधिकार प्राप्त एलएलएम (टूल के साथ, केवल विश्वसनीय इनपुट देखने वाला) को एक क्वारंटीन एलएलएम (बिना टूल के, अविश्वसनीय टेक्स्ट संभालने वाला) से अलग करती है, जो एक नियतात्मक नियंत्रक से जुड़े होते हैं। गूगल डीपमाइंड का सीएएमईएल (2024) एक वेरिफ़ायर का उपयोग करता है ताकि यह सुनिश्चित किया जा सके कि क्वारंटीन मॉडल केवल अनुमत टोकन का एक सख्त उपसमुच्चय आउटपुट करे। 2025 के एक पेपर के छह प्रोजेक्ट पैटर्न इस विचार का विस्तार करते हैं। एक ठोस कार्यान्वयन का वर्णन एफएक्यू जेनरेटर के लिए तीन पृथक मॉडलों का उपयोग करके किया गया है: एक विशेषाधिकार प्राप्त जिसकी कंपनी डेटा और टूल तक पहुंच है, एक क्वारंटीन अविश्वसनीय पेज टेक्स्ट के लिए, और एक संश्लेषण के लिए, उनके बीच नियतात्मक जांच के साथ।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार