AI सुरक्षा 🇷🇺 11.08.2026 21:02

एक AI की मदद से दूसरे AI के विचार पढ़े जा सकते हैं, जिससे पासवर्ड और कुंजियाँ उजागर होती हैं

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
शोधकर्ताओं ने एक हमले का प्रदर्शन किया है जो Anthropic, OpenAI और Google के मालिकाना LLM के छिपे हुए तर्क निशानों को दो API कॉलों के माध्यम से डिक्रिप्ट करता है, बिना लक्षित मॉडल पर हमला किए। इस विधि ने यह भी पाया कि सार्वजनिक एजेंट लॉग में सैकड़ों रहस्य, जिनमें पासवर्ड और कुंजियाँ शामिल हैं, एन्क्रिप्टेड ब्लॉकों के अंदर छिपे होते हैं।
ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, MATS और Snyk के आठ शोधकर्ताओं ने 10 अगस्त को एक प्रीप्रिंट प्रकाशित किया, जिसमें Anthropic, OpenAI और Google के मॉडलों के एन्क्रिप्टेड रीज़निंग ट्रेस पर हमले का वर्णन किया गया है। यह हमला एक मजबूत मॉडल (जैसे, Claude Opus 4.8) से एन्क्रिप्टेड ब्लॉक लेकर उसी प्रदाता के कमजोर मॉडल (जैसे, Haiku 4.5) को खिलाकर काम करता है, जिसे फिर रीज़निंग को शब्दशः फिर से लिखने के लिए कहा जाता है, जिससे वह डिक्रिप्ट हो जाता है। यह हमला एन्क्रिप्शन को नहीं तोड़ता और न ही मजबूत मॉडल पर हमला करता है; यह इस तथ्य का फायदा उठाता है कि एन्क्रिप्टेड ब्लॉक क्लाइंट को लौटा दिया जाता है और अगले अनुरोध के साथ फिर से भेजा जाना चाहिए। शोधकर्ताओं ने 120 Codeforces कार्यों पर डिक्रिप्टेड ट्रेस की प्रामाणिकता को सत्यापित किया। उन्होंने GitHub और Hugging Face से 6708 सार्वजनिक एजेंट लॉग भी स्कैन किए, जिसमें 315,320 रीज़निंग ब्लॉक प्राप्त हुए, जिनमें 704 अद्वितीय रहस्य थे, जिनमें 62 API कुंजियाँ, 33 पासवर्ड, 24 एक्सेस टोकन, साथ ही ईमेल, नाम और आंतरिक URL शामिल थे। उल्लेखनीय रूप से, इनमें से 64 रहस्य दृश्यमान सत्र में कहीं भी दिखाई नहीं दे रहे थे, केवल एन्क्रिप्टेड ब्लॉक के अंदर मौजूद थे। पेपर एक पॉइज़निंग वेक्टर का भी वर्णन करता है, जहां एक दुर्भावनापूर्ण ब्लॉक लगाया जा सकता है ताकि एजेंट में निर्देश इंजेक्ट किए जा सकें, जो बाद में उसे लोड करता है। लेखक ब्लॉक को सत्र, उपयोगकर्ता और मॉडल से बांधने के लिए क्रिप्टोग्राफिक और सिस्टम उपायों का प्रस्ताव करते हैं, लेकिन फिलहाल, उपयोगकर्ताओं को एन्क्रिप्टेड रीज़निंग ब्लॉक को रहस्य के रूप में मानना चाहिए और लॉग को सार्वजनिक रूप से साझा करने से बचना चाहिए।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार