De Donkere Kant van LLM’s: Hoe en Waarom Ze Worden Bewapend (en Wat We Eraan Kunnen Doen)
Grote taalmodelen (LLM’s) zijn kwetsbaar voor jailbreak-aanvallen die hun veiligheidsmechanismen omzeilen, waardoor ze schadelijke inhoud kunnen produceren, zoals instructies voor misdaden. Bedreigingsactoren gebruiken ook speciale black-hat LLM’s voor cybercriminaliteit. Verdedigingen omvatten gelaagde filtering, adversariële training en het verzamelen van crowdsourced aanvalsgegevens via projecten zoals Gandalf.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
