AI सुरक्षाशोध 🇺🇸 12.08.2026 04:03

फ्रंटियर एआई मॉडल से छिपे तर्क निकालने की नई विधि

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
शोधकर्ताओं ने फ्रंटियर एआई मॉडल के छिपे तर्क को निकालने का एक तरीका खोजा है, जो संभावित रूप से डिस्टिलेशन हमलों को सक्षम कर सकता है और निजी जानकारी उजागर कर सकता है। उन्होंने OpenAI, Anthropic और Google के मॉडल में यह समस्या पहचानी, और पाया कि चीनी मॉडल Kimi K3, Claude Opus और GPT-5.6 के समान आश्चर्यजनक रूप से समान तर्क उत्पन्न करता है, हालांकि यह डिस्टिलेशन का निर्णायक प्रमाण नहीं है। कंपनियों ने इस कमजोरी को कम किया है, लेकिन पूरी तरह से ठीक नहीं किया है।
कंप्यूटर वैज्ञानिकों, जिनमें ट्यूबिंगन विश्वविद्यालय के अलेक्जेंडर पैन्फिलोव भी शामिल हैं, ने अग्रणी एआई मॉडलों की छिपी 'सोच' को निकालने की एक विधि खोजी है। यह तकनीक इस तथ्य का फायदा उठाती है कि कंपनियां छोटे, कम संरेखित मॉडल वेरिएंट पेश करती हैं जो समान डिक्रिप्शन कुंजी साझा करते हैं लेकिन आंतरिक तर्क को प्रकट करने के लिए अधिक इच्छुक होते हैं। इन छोटे मॉडलों को एन्क्रिप्टेड तर्क निशान खिलाकर, शोधकर्ता बड़े मॉडलों के तर्क को उजागर कर सकते हैं, संभावित रूप से आसवन हमलों को सक्षम कर सकते हैं और एपीआई कुंजी और पासवर्ड जैसी व्यक्तिगत जानकारी को उजागर कर सकते हैं। उन्होंने पाया कि मूनशॉट एआई का चीनी मॉडल किमी के3 ने क्लाउड ओपस 4.8 और जीपीटी-5.6 सोल के समान तर्क उत्पन्न किया, लेकिन ध्यान दिया कि यह कारणात्मक रूप से आसवन स्थापित नहीं करता है। इस कमजोरी की सूचना ओपनएआई, एंथ्रोपिक और गूगल को दी गई थी, जिन्होंने शमन उपाय लागू किए हैं, लेकिन पैन्फिलोव का कहना है कि कुछ तर्क निशान अभी भी निकाले जा सकते हैं। यह मुद्दा आसवन के बढ़ते भू-राजनीतिक महत्व को उजागर करता है, क्योंकि चीनी कंपनियों पर अमेरिकी मॉडलों की नकल करने के लिए इसका उपयोग करने का आरोप है, हालांकि विशेषज्ञ इसके वास्तविक प्रभाव पर विभाजित हैं।
स्रोत: Wired AI — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार