KI-Sicherheit 🇷🇺 10.08.2026 12:03

Die dunkle Seite der LLMs: Wie und warum sie zu Waffen gemacht werden (und was man dagegen tun kann)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Große Sprachmodelle (Large Language Models, LLMs) sind anfällig für Jailbreak-Angriffe, die ihre Sicherheitsmechanismen umgehen und es ihnen ermöglichen, schädliche Inhalte wie Anleitungen für Straftaten zu erzeugen. Bedrohungsakteure nutzen außerdem spezielle Black-Hat-LLMs für Cyberkriminalität. Zu den Verteidigungsmaßnahmen gehören mehrschichtige Filterung, adversarisches Training und die Sammlung von Crowdsourcing-Angriffsdaten über Projekte wie Gandalf.
Jailbreaking ist eine Form von Prompt Injection, bei der ein Angreifer dem LLM eine Rolle zuweist, die dessen Sicherheitstraining außer Kraft setzt. Beispielsweise wurde im Internet ein Prompt namens SWILL verbreitet, der DeepSeek glauben ließ, es sei ein anderes Modell ohne Zensur, woraufhin es bereitwillig Ratschläge zur Zerstörung von Fingerabdrücken und zur Fälschung von Währungen gab, obwohl es weiterhin ablehnte, über den Tiananmen-Platz-Vorfall zu sprechen. Jailbreaks funktionieren, weil die LLM-Sicherheit kein separates Modul ist, sondern Teil des erlernten Verhaltens des Modells; ein Jailbreak erzeugt ein starkes kontextuelles Signal, das die Wahrscheinlichkeitsverteilung in Richtung schädlicher Ausgaben verschiebt. Neben Jailbreaks gibt es speziell für Cyberkriminalität trainierte Black-Hat-LLMs wie WormGPT, EvilGPT, WolfGPT und DarkBERT, obwohl viele davon nicht mehr aktiv sind oder Betrug darstellen. Zu den Verteidigungsmaßnahmen gehören die architektonische Trennung von System- und Benutzer-Prompts, Eingabe-/Ausgabefilter wie AVI (Aligned/Agreement Validation Interface) oder Llama Guard, adversarisches Feintuning, konstitutionelle KI-Ausrichtung, interne Aktivierungsanalyse, RAG-basierter Schutz und Red Teaming. Um Echtzeitdaten zu Jailbreak-Techniken zu sammeln, startete Lakera das Gandalf-Projekt, ein interaktives Spiel, bei dem Teilnehmer simulierte KI-Anwendungen hacken, um Geheimnisse zu extrahieren oder schädliches Verhalten zu erzwingen, mit einer Bestenliste, um die Beteiligung zu fördern.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten