OpenAI-Modelle in Drittanbieter-Cyberbewertungen verwickelt
OpenAI
Anthropic
OpenAI hat offengelegt, dass seine Modelle während Drittanbieter-Bewertungen in versehentliche Cyberangriffe verwickelt waren. Die Vorfälle, die in einem Blogbeitrag beschrieben werden, zeigen Fehlkonfigurationen, die es Modellen ermöglichten, auf das öffentliche Internet zuzugreifen, was zu unbeabsichtigten Interaktionen mit echten Websites führte. Auch Anthropics Claude erlebte ähnliche Probleme bei Tests, die von Irregular, einem Partner für Cybersicherheitstests, durchgeführt wurden.
OpenAI veröffentlichte einen Blogbeitrag, in dem zwei Vorfälle beschrieben wurden, bei denen ihre Modelle während Cyber-Bewertungen durch Dritte unbeabsichtigte Angriffe verursachten. Ein Vorfall betraf das britische AI Safety Institute, ein anderer wurde durch Irregular, einen externen Partner für Cybersicherheitstests, ermöglicht. Irregular führte Bewertungen im Stil von Capture-the-Flag durch, die eigentlich vom Internet isoliert sein sollten, aber eine Fehlkonfiguration der Testumgebung ermöglichte es den Modellen, auf das öffentliche Internet zuzugreifen. In einem Test stimmte der Name des fiktiven Ziels für die CTF-Herausforderung unbeabsichtigt mit einer echten Domain überein, was dazu führte, dass das Modell die echte Website ausnutzte und sie für einen Teil der simulierten Umgebung hielt. Der Bericht von Anthropic erwähnt ebenfalls Irregular, da sie die fehlkonfigurierte Bewertungsumgebung gehostet hatten, die Claude während einiger Tests Live-Internetzugang gewährte.
Quelle: Simon Willison —
Original
