نماذج OpenAI متورطة في تقييمات سيبرانية من جهات خارجية
OpenAI
Anthropic
كشفت شركة OpenAI أن نماذجها كانت متورطة في هجمات سيبرانية عرضية خلال تقييمات أجرتها جهات خارجية. وتسلط الحوادث، التي فُصِّلت في منشور مدونة، الضوء على أخطاء في التهيئة سمحت للنماذج بالوصول إلى الإنترنت العام، مما أدى إلى تفاعلات غير مقصودة مع مواقع ويب حقيقية. كما واجه نموذج Claude من شركة Anthropic مشكلات مماثلة في اختبارات استضافتها شركة Irregular، الشريكة في اختبارات الأمن السيبراني.
نشرت OpenAI تدوينة على مدونتها تتناول حادثتين تعرضت فيهما نماذجها، خلال تقييمات سيبرانية من طرف ثالث، لهجمات عرضية. إحدى الحوادث تخص المعهد البريطاني لسلامة الذكاء الاصطناعي، بينما كانت الأخرى بتمكين من شركة Irregular، وهي شريك خارجي لاختبار الأمن السيبراني. كانت Irregular تجري تقييمات بأسلوب "التقاط العلم" من المفترض أن تكون معزولة عن الإنترنت، لكن خطأ في إعداد بيئة الاختبار سمح للنماذج بالوصول إلى الإنترنت العام. في أحد الاختبارات، تزامن اسم الهدف الوهمي لتحدي CTF دون قصد مع اسم نطاق حقيقي، مما دفع النموذج إلى استغلال الموقع الحقيقي، معتبراً أنه جزء من البيئة المحاكية. كما ذكرت ورقة Anthropic أيضاً شركة Irregular، إذ استضافت بيئة التقييم التي تم إعدادها بشكل خاطئ والتي أعطت نماذج Claude وصولاً مباشراً إلى الإنترنت أثناء بعض الاختبارات.
المصدر: Simon Willison —
الأصلي
