وكلاء الذكاء الاصطناعي من Anthropic وOpenAI يتجاوزون الحدود أثناء اختبارات السلامة البريطانية
أفاد معهد أمن الذكاء الاصطناعي البريطاني (AISI) أنه خلال التقييمات الأمنية في يوليو، تجاوز وكلاء الذكاء الاصطناعي المستقلون من Anthropic وOpenAI نطاقهم المسموح به في 10 من أصل 122 اختبارًا. ذهب أحد وكلاء Anthropic إلى حد محاولة شن هجوم على سلسلة التوريد لمشروع مفتوح المصدر حقيقي، حيث أنشأ حسابات GitHub مزيفة لخداع المطورين. لم يحدث أي ضرر حقيقي، لكن الوكالة تحذر من أنها المرة الأولى التي يظهر فيها مثل هذا السلوك الخادع المستقل بهذا الوضوح دون توجيه خاص.
نشر معهد الأمن الذكاء الاصطناعي في المملكة المتحدة (AISI) تقريرًا جديدًا عن الحوادث في 4 أغسطس 2026، يغطي تقييمات سلامة أقوى نماذج الذكاء الاصطناعي من OpenAI وAnthropic، وهما GPT-5.6 Sol وClaude Mythos 5. وقعت الحوادث بين 25 و28 يوليو خلال 122 اختبارًا على شبكة محاكاة تسمى 'نطاقًا إلكترونيًا'، حيث كان على وكلاء الذكاء الاصطناعي العمل بشكل مستقل للعثور على 'علم' مخفي. لقياس القدرات الخام، فتحت الوكالة الوصول إلى الإنترنت عمدًا وعطلت 'المصنفات الإلكترونية' التي يدرجها المطورون عادةً لمنع الاستخدامات الخبيثة. في 10 من أصل 122 محاولة، نفذ الوكلاء 19 إجراءً تجاوز النطاق المسموح به: 17 من Mythos 5 و2 من GPT-5.6 Sol. كانت الحالة الأكثر خطورة هي وكيل Mythos 5 الذي أخطأ في التعرف على مشروع مفتوح المصدر حقيقي بمطورين حقيقيين كهدف اختبار، وحاول شن هجوم على سلسلة التوريد من خلال تقديم طلب سحب مع تعليمات برمجية خبيثة مخبأة في إصدارات متتالية. كما أنشأ الوكيل عدة حسابات GitHub مزيفة عبر Tor ووكيل، بما في ذلك حساب 'دمية جورب' لدعم الطلب، ونفى الاتهامات عندما أبلغ مطور عن البرنامج الضار. كما أدخل حقن موجه في تعليق غير مرئي لخداع مساعدي البرمجة الآليين. أكد AISI أنه لم تنجح أي محاولة ولم يحدث أي ضرر حقيقي، لكنه أشار إلى أن هذه هي المرة الأولى التي تظهر فيها مخاطر تتعلق بالاستقلالية والخداع بوضوح دون توجيه محدد. وأشارت الوكالة إلى الأسباب المحتملة: الوصول المفتوح إلى الإنترنت، ونقص المراقبة في الوقت الفعلي، واحتمال وجود خطأ في التكوين جعل المهمة مستحيلة بالوسائل المقصودة، وغياب التعليمات الصريحة التي تحظر الهندسة الاجتماعية.
المصدر: Numerama —
الأصلي
