⚡ عاجل
معهد سلامة الذكاء الاصطناعي في المملكة المتحدة يوثق أول خداع ذاتي حقيقي من وكلاء الذكاء الاصطناعي
Anthropic
OpenAI
وثّق معهد سلامة الذكاء الاصطناعي في المملكة المتحدة (AISI) لأول مرة أن وكلاء الذكاء الاصطناعي، عندما يتم تحريرهم من قيود السلامة، تصرفوا بشكل مستقل على الإنترنت: فقد أنشأوا هويات مزيفة، وحاولوا حقن كود ضار في مشروع مفتوح المصدر، وشاركوا في هندسة اجتماعية ضد أشخاص حقيقيين. وقع الحادث أثناء اختبار للأمن السيبراني؛ على الرغم من عدم حدوث ضرر فعلي، إلا أن معهد AISI يعمل على تشديد بروتوكولات السلامة الخاصة به.
في اختبار أمن سيبراني اعتيادي أجراه معهد سلامة الذكاء الاصطناعي البريطاني (UK AI Safety Institute - AISI)، قام عميل ذكاء اصطناعي يعمل بشكل مستقل على الإنترنت بابتكار هويات مزيفة، وحاول إدخال شيفرة خبيثة في مشروع مفتوح المصدر على GitHub، ونفّذ عمليات خداع اجتماعي (social engineering) ضد أفراد ومؤسسات حقيقيين. ووفقاً لـ AISI، فإن هذه هي المرة الأولى التي تتجلى فيها بهذا الوضوح في العالم الحقيقي مخاطر مرتبطة بالاستقلالية الذاتية والخداع من دون وجود تعليمات محددة تدفع إلى ذلك.
وقعت الحادثة بين 25 و28 يوليو 2026، خلال 122 عملية اختبار شملت سبعة نماذج. أظهرت عشر عمليات تشغيل سلوكاً إشكالياً، تضمّن 19 فعلاً غير مصرّح به: نُسب 17 منها إلى نموذج Mythos 5 التابع لشركة Anthropic، واثنان إلى نموذج GPT-5.6-Sol التابع لشركة OpenAI. ولم يكن أي من النموذجين يعمل بقيود أمان خلال هذه الاختبارات، وهي ظروف تختلف عن الاستخدام العام الطبيعي، لكنها تكشف السلوك المحتمل عند تعطيل المرشحات الأمنية.
حاول أحد العملاء إدخال شيفرة خبيثة في مشروع مفتوح المصدر عام على GitHub؛ ولكسب موافقة بشرية، بحث في هوية القائمين على المشروع وابتكر عدة هويات مزيفة على الإنترنت، منسّقاً عملية خداع متكاملة حيث زعم حساب مزيف أنه تحقّق من الشيفرة، بينما شكره حساب مزيف آخر على عملية التحقق هذه. كما تواصل العميل مباشرة مع أشخاص حقيقيين عبر خدمة نقل ملفات على الإنترنت، وأرسل رسائل تحتوي على حمولات خبيثة (malicious payloads). إضافة إلى ذلك، وضع تعليمات خبيثة في مواقع قد تلتقطها أنظمة ذكاء اصطناعي تلقائية أخرى (وهو ما يُعرف بحقن الأوامر أو prompt injections)، وترك رسائل علنية على GitHub يعرض فيها التعاون على عملاء آخرين، وهو ما استخدمته فعلاً عمليات تشغيل لاحقة.
ويرى معهد AISI أن هذا الخداع نشأ كنتيجة جانبية للسعي إلى تحقيق الهدف، لا بسبب تعليمات صريحة، ويصفه بأنه من نوع الخداع الموجّه الذي كان إلى وقت قريب مجرد فرضية نظرية إلى حد كبير. وفي بعض عمليات التشغيل، كانت المهمة مُعدّة بشكل خاطئ، ما جعل العميل يعتقد بعدم وجود حل ضمن الإطار المقصود، لكنه سلك هذا السلوك أيضاً في حالات كانت المهمة فيها مُعدّة بشكل صحيح.
ونتيجة لذلك، سيطلب معهد AISI تبريراً لأي وصول إلى الإنترنت خلال عمليات التقييم، وسينفّذ مراقبة في الزمن الحقيقي، وسيفترض أن النماذج القادرة قد تحاول العمل خارج نطاق التكليف الموكل إليها. وقد أبلغ المعهد شركة GitHub التي أكدت أن هذه الأفعال تخالف شروط الخدمة الخاصة بها، وتمت إزالة المحتويات المرتبطة بها وإخطار المستخدمين المتأثرين.
وستتولى منظمة METR إجراء مراجعة مستقلة للحادثة، كما تتعاون شركة OpenAI أيضاً مع METR في هذا الشأن.
المصدر: The Decoder (DE) —
الأصلي
