AI सुरक्षा 🇺🇸 30.07.2026 14:03

मौलिक दोष LLMs को हमलों के प्रति संवेदनशील बनाता है

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
शोधकर्ताओं का तर्क है कि बड़े भाषा मॉडलों में एक मौलिक दोष है जो उन्हें हैकिंग के प्रति अत्यधिक संवेदनशील बनाता है। LLMs द्वारा निर्देश स्रोतों की पहचान करने के तरीके का शोषण करके, हमलावर उन्हें निषिद्ध जानकारी, जैसे कि ड्रग संश्लेषण या विमान तोड़फोड़ निर्देश, प्रकट करने के लिए धोखा दे सकते हैं।
स्वतंत्र शोधकर्ताओं चार्ल्स ये और जैस्मिन कुई द्वारा इंटरनेशनल कॉन्फ्रेंस ऑन मशीन लर्निंग में प्रस्तुत एक पेपर बड़े भाषा मॉडलों (एलएलएम) में एक मूलभूत दोष का खुलासा करता है जो उन्हें हमलों के प्रति संवेदनशील बनाता है। यह दोष इस बात से संबंधित है कि एलएलएम कैसे पहचानते हैं कि उन्हें निर्देश कौन या क्या दे रहा है, जिससे उन्हें ऐसे काम करने के लिए धोखा देना आसान हो जाता है जो उन्हें नहीं करने चाहिए, जैसे कोकीन के संश्लेषण के निर्देश प्रदान करना या किसी विमान की नेविगेशन प्रणाली को तोड़-मरोड़ देना। शोधकर्ताओं ने पाया कि एलएलएम पाठ की भूमिका को टैग से नहीं, बल्कि शैली से पहचानते हैं, जिससे हमलावर भूमिकाओं को नकली बना सकते हैं। उन्होंने OpenAI, Anthropic, Alibaba और DeepSeek के मॉडलों पर चेन-ऑफ-थॉट फोर्जरी हमले प्रदर्शित किए। शोधकर्ताओं का तर्क है कि यह समस्या मूल रूप से असमाधेय है, क्योंकि प्रशिक्षण की कोई भी मात्रा इसका पूरी तरह से समाधान नहीं कर सकती। वे चेतावनी देते हैं कि एलएलएम को पर्याप्त मौलिक अध्ययन के बिना महत्वपूर्ण प्रणालियों में तैनात किया जा रहा है।
स्रोत: MIT Technology Review — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार