मौलिक दोष LLMs को हमलों के प्रति संवेदनशील बनाता है
OpenAI
Anthropic
Alibaba/Qwen
DeepSeek
शोधकर्ताओं का तर्क है कि बड़े भाषा मॉडलों में एक मौलिक दोष है जो उन्हें हैकिंग के प्रति अत्यधिक संवेदनशील बनाता है। LLMs द्वारा निर्देश स्रोतों की पहचान करने के तरीके का शोषण करके, हमलावर उन्हें निषिद्ध जानकारी, जैसे कि ड्रग संश्लेषण या विमान तोड़फोड़ निर्देश, प्रकट करने के लिए धोखा दे सकते हैं।
स्वतंत्र शोधकर्ताओं चार्ल्स ये और जैस्मिन कुई द्वारा इंटरनेशनल कॉन्फ्रेंस ऑन मशीन लर्निंग में प्रस्तुत एक पेपर बड़े भाषा मॉडलों (एलएलएम) में एक मूलभूत दोष का खुलासा करता है जो उन्हें हमलों के प्रति संवेदनशील बनाता है। यह दोष इस बात से संबंधित है कि एलएलएम कैसे पहचानते हैं कि उन्हें निर्देश कौन या क्या दे रहा है, जिससे उन्हें ऐसे काम करने के लिए धोखा देना आसान हो जाता है जो उन्हें नहीं करने चाहिए, जैसे कोकीन के संश्लेषण के निर्देश प्रदान करना या किसी विमान की नेविगेशन प्रणाली को तोड़-मरोड़ देना। शोधकर्ताओं ने पाया कि एलएलएम पाठ की भूमिका को टैग से नहीं, बल्कि शैली से पहचानते हैं, जिससे हमलावर भूमिकाओं को नकली बना सकते हैं। उन्होंने OpenAI, Anthropic, Alibaba और DeepSeek के मॉडलों पर चेन-ऑफ-थॉट फोर्जरी हमले प्रदर्शित किए। शोधकर्ताओं का तर्क है कि यह समस्या मूल रूप से असमाधेय है, क्योंकि प्रशिक्षण की कोई भी मात्रा इसका पूरी तरह से समाधान नहीं कर सकती। वे चेतावनी देते हैं कि एलएलएम को पर्याप्त मौलिक अध्ययन के बिना महत्वपूर्ण प्रणालियों में तैनात किया जा रहा है।
स्रोत: MIT Technology Review —
मूल
