طريقة جديدة تستخرج الاستدلال الخفي من نماذج الذكاء الاصطناعي الرائدة

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
وجد الباحثون طريقة لاستخراج الاستدلال الخفي لنماذج الذكاء الاصطناعي الرائدة، مما قد يتيح هجمات التقطير وكشف معلومات خاصة. وقد حددوا المشكلة في نماذج من OpenAI و Anthropic و Google، ووجدوا أن النموذج الصيني Kimi K3 ينتج استدلالًا مشابهًا بشكل لافت للنظر لـ Claude Opus و GPT-5.6، على الرغم من عدم وجود دليل قاطع على التقطير. وقد خففت الشركات من هذه الثغرة لكنها لم تصلحها بالكامل.
اكتشف علماء كمبيوتر، بمن فيهم ألكسندر بانفيلوف من جامعة توبنغن، طريقة لاستخراج "التفكير" الخفي لنماذج الذكاء الاصطناعي الرائدة. تستغل هذه التقنية حقيقة أن الشركات تقدم نماذج أصغر وأقل توافقًا تشترك في نفس مفتاح التشفير ولكنها أكثر استعدادًا للكشف عن الاستدلال الداخلي. من خلال تغذية آثار الاستدلال المشفرة إلى هذه النماذج الأصغر، تمكن الباحثون من كشف استدلال النماذج الأكبر، مما قد يتيح هجمات التقطير ويكشف معلومات شخصية مثل مفاتيح API وكلمات المرور. ووجدوا أن النموذج الصيني Kimi K3 من Moonshot AI أنتج استدلالًا مشابهًا بشكل لافت لنموذج Claude Opus 4.8 وGPT-5.6 Sol، لكنهم لاحظوا أن هذا لا يثبت بشكل قاطع التقطير. تم الإبلاغ عن الثغرة إلى OpenAI وAnthropic وGoogle، والتي نفذت إجراءات تخفيف، لكن بانفيلوف يقول إن بعض آثار الاستدلال لا يزال يمكن استخراجها. تسلط القضية الضوء على الأهمية الجيوسياسية المتزايدة للتقطير، حيث تتهم الشركات الصينية باستخدامه لنسخ النماذج الأمريكية، على الرغم من انقسام الخبراء حول تأثيره الفعلي.
المصدر: Wired AI — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة