GPT-Red: فريق الاختراق التلقائي من OpenAI لتحسين سلامة الذكاء الاصطناعي ذاتيًا
OpenAI
قدمت OpenAI نظام GPT-Red، وهو نظام فريق اختراق تلقائي يستخدم أسلوب اللعب الذاتي لتعزيز السلامة والتوافق والمتانة ضد حقن التعليمات (prompt injection) لنماذج اللغة الكبيرة. يسمح النظام للنموذج بتوليد سيناريوهات هجوم بشكل مستقل وضبطها دقيقًا عليها، مما يحسن متانته دون تدخل بشري مستمر.
كشفت OpenAI عن نظام GPT-Red، وهو نظام آلي للاختبار الأمني (Red Teaming) مصمم لتعزيز سلامة ومواءمة ومتانة الذكاء الاصطناعي. يستخدم النظام أسلوب التعلم الذاتي من خلال اللعب، حيث يقوم النموذج بشكل مستقل بتوليد هجمات استفزازية وسيناريوهات خبيثة، ثم يقوم بضبط نفسه بناءً عليها لتحسين دفاعاته. يتيح هذا النهج تعزيز متانة النموذج بشكل مستمر دون الحاجة المستمرة إلى مشاركة مختبرين بشريين. يتميز GPT-Red بفعاليته الخاصة في اكتشاف ومعالجة الثغرات المتعلقة بحقن الأوامر (Prompt Injection)، حيث يحاول المهاجم تجاوز قيود النموذج باستخدام استعلامات مصممة خصيصًا. يقوم النظام بتقييم نتائج الهجمات تلقائيًا ويستخدمها لتعديل سلوك النموذج، مما يجعل عملية تحسين الأمن أكثر قابلية للتوسع وكفاءة.
المصدر: OpenAI —
الأصلي
