Lakera

Laatste AI-nieuws, modellen en releases van Lakera.

AI-veiligheid 🇷🇺

De Donkere Kant van LLM’s: Hoe en Waarom Ze Worden Bewapend (en Wat We Eraan Kunnen Doen)

Grote taalmodelen (LLM’s) zijn kwetsbaar voor jailbreak-aanvallen die hun veiligheidsmechanismen omzeilen, waardoor ze schadelijke inhoud kunnen produceren, zoals instructies voor misdaden. Bedreigingsactoren gebruiken ook speciale black-hat LLM’s voor cybercriminaliteit. Verdedigingen omvatten gelaagde filtering, adversariële training en het verzamelen van crowdsourced aanvalsgegevens via projecten zoals Gandalf.

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
Vers nieuws