प्रॉम्प्ट इंजेक्शन फिल्टर से ठीक नहीं होता: आर्किटेक्चरल पैटर्न का उपयोग करके अविश्वसनीय टेक्स्ट को कैसे अलग करें
OpenAI
Anthropic
Google DeepMind
Microsoft
प्रॉम्प्ट इंजेक्शन एलएलएम एप्लिकेशनों में एक संरचनात्मक दोष बना हुआ है, जो सिस्टम प्रॉम्प्ट या क्लासिफायर द्वारा ठीक नहीं किया जाता। आर्किटेक्चरल पैटर्न जैसे डुअल-एलएलएम, Google DeepMind से CaMeL, और मेटा से एजेंट्स रूल ऑफ टू मजबूत अलगाव प्रदान करते हैं। लेख में खतरे का मॉडल, Microsoft 365 Copilot में EchoLeak कमजोरी, और तीन पृथक मॉडलों के साथ एक ठोस कार्यान्वयन का विवरण दिया गया है।
प्रॉम्प्ट इंजेक्शन, जिसे सितंबर 2022 में साइमन विलिसन ने पेश किया था, तब होता है जब एलएलएम के कॉन्टेक्स्ट में अविश्वसनीय टेक्स्ट को एक निर्देश के रूप में निष्पादित किया जाता है। जेलब्रेकिंग के विपरीत, यह उन एप्लिकेशन को प्रभावित करता है जहां मॉडल के पास टूल और डेटा तक पहुंच होती है, जिससे कंफ्यूज्ड डेप्युटी और डेटा एक्सफ़िलट्रेशन हमले होते हैं। लेख का तर्क है कि सिस्टम प्रॉम्प्ट और गार्डरेल क्लासिफ़ायर अप्रभावी हैं, 2025 में ओपनएआई, एंथ्रोपिक और गूगल डीपमाइंड द्वारा किए गए एक अध्ययन का हवाला देते हुए जिसमें दिखाया गया कि अनुकूली हमलों ने 90% से अधिक सफलता दर के साथ 12 प्रकाशित बचावों को दरकिनार कर दिया। साइमन विलिसन का 'लेथल ट्राइफेक्टा' डेटा एक्सफ़िलट्रेशन के लिए तीन तत्वों की पहचान करता है: निजी डेटा तक पहुंच, अविश्वसनीय सामग्री के साथ संपर्क, और एक आउटबाउंड चैनल। माइक्रोसॉफ्ट 365 कोपायलट में इकोलीक भेद्यता (सीवीई-2025-32711) ने तीनों का शोषण किया। मेटा का 'एजेंट्स रूल ऑफ टू' कहता है कि एक एजेंट के पास तीन गुणों में से दो से अधिक नहीं होने चाहिए: अविश्वसनीय इनपुट प्रोसेस करना, संवेदनशील सिस्टम/डेटा तक पहुंच, और स्थिति बदलने या बाहरी रूप से संवाद करने की क्षमता। डुअल-एलएलएम (विलिसन, 2023) जैसी आर्किटेक्चर एक विशेषाधिकार प्राप्त एलएलएम (टूल के साथ, केवल विश्वसनीय इनपुट देखने वाला) को एक क्वारंटीन एलएलएम (बिना टूल के, अविश्वसनीय टेक्स्ट संभालने वाला) से अलग करती है, जो एक नियतात्मक नियंत्रक से जुड़े होते हैं। गूगल डीपमाइंड का सीएएमईएल (2024) एक वेरिफ़ायर का उपयोग करता है ताकि यह सुनिश्चित किया जा सके कि क्वारंटीन मॉडल केवल अनुमत टोकन का एक सख्त उपसमुच्चय आउटपुट करे। 2025 के एक पेपर के छह प्रोजेक्ट पैटर्न इस विचार का विस्तार करते हैं। एक ठोस कार्यान्वयन का वर्णन एफएक्यू जेनरेटर के लिए तीन पृथक मॉडलों का उपयोग करके किया गया है: एक विशेषाधिकार प्राप्त जिसकी कंपनी डेटा और टूल तक पहुंच है, एक क्वारंटीन अविश्वसनीय पेज टेक्स्ट के लिए, और एक संश्लेषण के लिए, उनके बीच नियतात्मक जांच के साथ।
स्रोत: Habr — хаб ИИ —
मूल
