Die dunkle Seite der LLMs: Wie und warum sie zu Waffen gemacht werden (und was man dagegen tun kann)
Große Sprachmodelle (Large Language Models, LLMs) sind anfällig für Jailbreak-Angriffe, die ihre Sicherheitsmechanismen umgehen und es ihnen ermöglichen, schädliche Inhalte wie Anleitungen für Straftaten zu erzeugen. Bedrohungsakteure nutzen außerdem spezielle Black-Hat-LLMs für Cyberkriminalität. Zu den Verteidigungsmaßnahmen gehören mehrschichtige Filterung, adversarisches Training und die Sammlung von Crowdsourcing-Angriffsdaten über Projekte wie Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
