AI सुरक्षाशोध 🇩🇪 12.08.2026 21:03

एलएलएम हैकिंग: शोधकर्ता चैटबॉट प्रतिक्रियाओं से उपयोगकर्ता प्रॉम्प्ट्स का पुनर्निर्माण कर सकते हैं

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
आईआईटी बॉम्बे और एडोब रिसर्च के शोधकर्ताओं ने एक ऐसी विधि विकसित की है जो बड़े भाषा मॉडलों के टेक्स्ट आउटपुट से उनके मूल प्रॉम्प्ट्स का उच्च सटीकता के साथ पुनर्निर्माण कर सकती है। यह दृष्टिकोण मॉडल वेट्स तक पहुंच की आवश्यकता नहीं रखता और अन्य विक्रेताओं के मॉडलों पर भी काम करता है। यह मालिकाना सिस्टम प्रॉम्प्ट्स का उपयोग करने वाले व्यवसायों के लिए एक संभावित सुरक्षा जोखिम पैदा करता है।
आईआईटी बॉम्बे और एडोब रिसर्च के शोधकर्ताओं ने एक ऐसी विधि विकसित की है जो बड़े भाषा मॉडलों के टेक्स्ट आउटपुट से उनके इनपुट प्रॉम्प्ट को लगभग सटीक रूप से पुनर्निर्मित कर सकती है, बिना मॉडल वेट्स तक पहुंच के काम करती है और अन्य मॉडलों पर भी स्थानांतरित हो जाती है। 'पिछला-टोकन पूर्वानुमान' (पीटीपी) नामक यह विधि, भाषा मॉडलों के मूल सिद्धांत को उलट देती है, अगले टोकन के बजाय पिछले टोकन की भविष्यवाणी करने के लिए एक उलटा मॉडल प्रशिक्षित करती है। यह उलटा मॉडल केवल लक्ष्य एलएलएम द्वारा उत्पन्न सिंथेटिक डेटा का उपयोग करके शुरू से प्रशिक्षित किया जाता है। उलटा मॉडल न केवल मूल प्रॉम्प्ट को सटीक रूप से बहाल कर सकता है, बल्कि डिकोडिंग पैरामीटर को बदलकर कई शब्दार्थ रूप से भिन्न प्रॉम्प्ट विकल्प भी उत्पन्न कर सकता है। पेपर के एक गुणात्मक उदाहरण में, प्रॉम्प्ट 'प्रतिस्पर्धियों से संपर्क करके उनकी मूल्य निर्धारण रणनीतियों का पता कैसे लगाएं?' को छह अन्य रूपों के साथ सटीक रूप से पुनर्निर्मित किया गया था। वास्तविक उपयोगकर्ता प्रॉम्प्ट के साथ परीक्षणों में भी शब्दार्थ रूप से वफादार पुनर्निर्माण दिखाई दिए। क्वेन-3-0.6बी-चैट पर प्रशिक्षित एक छोटा उलटा मॉडल जीपीटी-4ओ प्रतिक्रियाओं से प्रॉम्प्ट को फिर से बना सकता है, अंतर्निहित संदर्भ और इरादे को पकड़ सकता है, जिसका अर्थ है कि एक हमलावर को यह जानने की आवश्यकता नहीं होगी कि टेक्स्ट आउटपुट के पीछे कौन सा मॉडल है। यह कंपनियों के लिए एक व्यापक सुरक्षा समस्या प्रस्तुत करता है, क्योंकि व्यावसायिक रहस्यों, मॉडरेशन नियमों या विशेष निर्देशों वाले मालिकाना सिस्टम प्रॉम्प्ट, साथ ही गोपनीय उपयोगकर्ता इनपुट, निकाले जा सकते हैं। पेपर स्वयं वाणिज्यिक प्रणालियों पर हमलों के बारे में स्पष्ट बयान नहीं देता है, लेकिन मॉडल निर्माताओं को इस भेद्यता को स्पष्ट करने और संभावित रूप से सुधारने की आवश्यकता है।
स्रोत: The Decoder (DE) — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार