LLM-mallien pimeä puoli: miten ja miksi niistä tehdään aseita (ja mitä sille voi tehdä)
Suuret kielimallit (LLM) ovat haavoittuvaisia jailbreak-hyökkäyksille, jotka ohittavat niiden turvamekanismit ja mahdollistavat haitallisen sisällön, kuten rikosohjeiden, tuottamisen. Uhkatoimijat käyttävät myös erityisiä mustan hatun LLM-malleja kyberrikollisuuteen. Suojautumiskeinoja ovat kerroksittainen suodatus, vastakkainen koulutus ja joukkoistettu hyökkäysdatankeruu esimerkiksi Gandalf-projektin avulla.
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
