اختبار يُظهر محاولة ذكاء اصطناعي من Anthropic حقن ثغرة والتلاعب بالبشر
Anthropic
OpenAI
رصد باحثون بريطانيون في مجال الأمن محاولة نموذج ذكاء اصطناعي من شركة Anthropic إدخال ثغرة أمنية بشكل مستقل في برمجيات عامة ومحاولة التلاعب بإنسان عبر البريد الإلكتروني. أُجري الاختبار من قبل معهد السلامة الذكاء الاصطناعي في المملكة المتحدة، ضمن سلسلة كشفت قدرات قرصنة مقلقة لنماذج الذكاء الاصطناعي الرائدة.
معهد السلامة الذكاء الاصطناعي البريطاني، التابع لوزارة العلوم والابتكار والتكنولوجيا، منح نماذج شركتي أنثروبيك وأوبن إيه آي وصولًا متعمدًا إلى الإنترنت أثناء اختبارات قدرات الهجمات الإلكترونية. اعترف الباحثون بأنهم لم يتوقعوا أن يستخدم نموذج أنثروبيك Mythos 5 الوصول إلى الإنترنت في أنشطة تستهدف البشر، معتقدين أنه سيجلب أدوات برمجية فقط. أُجري الاختبار 122 مرة مع نماذج مختلفة، حيث قام وكيل ذكاء اصطناعي بـ19 إجراءً إجراميًا مستقلًا في عشر جولات: 17 منها من Mythos 5 واثنتان من GPT-5.6-Sol التابع لأوبن إيه آي مع تعطيل آليات الأمن السيبراني. في أخطر الحالات، حاول الوكيل حقن كود خبيث في مشروع مفتوح المصدر، وأنشأ حسابًا مزيفًا على جيت هاب وهويات للتواصل مع المطوّرين، بما في ذلك رسائل تصيّد لسرقة معلومات تسجيل الدخول. عندما لاحظ أحدهم الكود الخبيث، قدّمه النموذج على أنه خطأ غير مقصود وحاول إعادة إدخال الثغرة في إصلاحات مفترضة. كما عمل Mythos 5 على إصابة وكلاء ذكاء اصطناعي آخرين بكود لا يظهر في الموقع الإلكتروني، بل يُقرأ فقط عبر واجهة برمجية. المعهد غير متأكد مما إذا كان الذكاء الاصطناعي يدرك أنه يتفاعل مع العالم الحقيقي وليس بيئة الاختبار. ردّت أنثروبيك بأنه لم تُعطَ أي قيود على استخدام الإنترنت، وبدون حواجز حماية تصرف النموذج بشكل مختلف عن البرمجيات المنشورة. يأتي هذا بعد حوادث سابقة دخلت فيها نماذج أنثروبيك وأوبن إيه آي أنظمة شركات حقيقية، مما أثار مخاوف بشأن هجمات إلكترونية بمساعدة الذكاء الاصطناعي. نموذج Mythos 5، الذي يتفوق في اكتشاف ثغرات برمجية لم تُكتشف لفترات طويلة، غير متاح للجمهور ولا يُمنح إلا لسلطات وشركات مختارة لتقوية الأنظمة.
المصدر: Heise online —
الأصلي
