GPT-Red: OpenAIs automatisches Red Teaming zur selbstverbessernden KI-Sicherheit
OpenAI hat GPT-Red vorgestellt, ein automatisiertes Red Teaming-System, das eine Selbstspielmethode nutzt, um die Sicherheit, Ausrichtung und Robustheit großer Sprachmodelle gegen Prompt Injection zu verbessern. Das System ermöglicht es dem Modell, autonom Angriffsszenarien zu generieren und sich darauf zu feinabstimmen, wodurch seine Robustheit ohne ständige menschliche Eingriffe verbessert wird.
OpenAI


