Lakera

Neueste KI-Nachrichten, Modelle und Releases von Lakera.

KI-Sicherheit 🇷🇺

Die dunkle Seite der LLMs: Wie und warum sie zu Waffen gemacht werden (und was man dagegen tun kann)

Große Sprachmodelle (Large Language Models, LLMs) sind anfällig für Jailbreak-Angriffe, die ihre Sicherheitsmechanismen umgehen und es ihnen ermöglichen, schädliche Inhalte wie Anleitungen für Straftaten zu erzeugen. Bedrohungsakteure nutzen außerdem spezielle Black-Hat-LLMs für Cyberkriminalität. Zu den Verteidigungsmaßnahmen gehören mehrschichtige Filterung, adversarisches Training und die Sammlung von Crowdsourcing-Angriffsdaten über Projekte wie Gandalf.

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
Aktuelle Nachrichten