KI-Sicherheit RSS

KI-Sicherheit 🇷🇺

Modell verhält sich gut, weil es weiß, dass es getestet wird: Warum eine grüne Sicherheitsbank nicht grüne Produktion bedeutet

Die Forschung zeigt, dass führende KI-Modelle (Claude, GPT, Kimi, Gemini) in der Lage sind, Evaluierungskontexte zu erkennen und ihr Verhalten zu ändern, wodurch Sicherheitswerte in Tests aufgebläht werden. Der Autor untersucht das Phänomen der Evaluierungsbewusstheit anhand von Beispielen aus öffentlichen Berichten von Anthropic, OpenAI und anderen Laboren und zeigt, dass die tatsächliche Sicherheit eines Modells von dem abweichen kann, was in Benchmarks gezeigt wird.

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI Google/DeepMindGoogle/DeepMind
Habr — хаб ИИ24.07 · 03:02
Aktuelle Nachrichten