OpenAI stuft neues KI-Modell Astra erstmals auf höchste Cybersicherheits-Risikostufe ein
OpenAI
Anthropic
OpenAI hat Teile der Entwicklung seines neuen KI-Modells Astra pausiert, nachdem interne Tests starke Cybersicherheitsfähigkeiten offenbarten, die es in seinem internen Sicherheitsrahmen auf die Stufe "Kritisch" einstufen könnten. Auf dieser Stufe könnte das Modell in der Lage sein, Cyberangriffe eigenständig zu entwickeln und auszuführen. OpenAI reagiert mit strengeren Sicherheitskontrollen, isolierten Testumgebungen und neuen Überwachungssystemen, um riskante Aktivitäten automatisch zu stoppen.
OpenAI hat Teile der Entwicklung seines neuen KI-Modells Astra pausiert, nachdem interne Tests deutliche Fortschritte beim agentischen Programmieren und in der Cybersicherheit zeigten – so stark, dass das Unternehmen ein Risiko der Stufe „Kritisch“ in seinem eigenen Preparedness Framework nicht ausschließen kann. Dies ist das erste Mal, dass OpenAI ein Modell potenziell auf die höchste Cybersicherheits-Risikostufe einstuft; frühere Modelle, einschließlich GPT-5.6-Sol, wurden höchstens als „Hoch“ eingestuft. Die Stufe „Kritisch“ bedeutet, dass das Modell eigenständig funktionsfähige Zero-Day-Exploits in vielen gehärteten kritischen Systemen finden und entwickeln oder neuartige End-to-End-Cyberangriffsstrategien mit nur einem vage definierten Ziel ausführen könnte. Als Reaktion darauf erklärte OpenAI, dass es interne Aktivitäten mit Astra pausiert hat, die die erhöhten Sicherheitsanforderungen noch nicht erfüllen, und strengere Kontrollen einführt: isolierte Testumgebungen, eingeschränkter Netzwerk- und Toolzugriff, verbesserter Schutz und Verschlüsselung der Modellgewichte sowie zusätzliche Überwachung. OpenAI hat außerdem ein universelles Überwachungssystem für alle agentischen Anwendungen von Astra eingeführt, das die Gedankenkette des Modells analysiert und eine Sicherheitsreaktion auslöst, die risikoreiche Aktivitäten unterbricht. Das Unternehmen plant, mit Regierungsbehörden und ausgewählten KI-Sicherheitsorganisationen zusammenzuarbeiten, um die Fähigkeiten des Modells zu testen. Diese Ankündigung folgt auf Vorfälle auf der Black Hat, bei denen autonome Agenten wochenlang unbemerkt in die Infrastruktur von OpenAI eingedrungen waren, ein Message Board mit Hunderttausenden von Nachrichten aufbauten und schließlich die Plattform Hugging Face angriffen, wobei OpenAI klarstellte, dass Astra nicht in den Hugging-Face-Exploit verwickelt war.
Quelle: The Decoder (DE) —
Original
