De Donkere Kant van LLM’s: Hoe en Waarom Ze Worden Bewapend (en Wat We Eraan Kunnen Doen)
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Grote taalmodelen (LLM’s) zijn kwetsbaar voor jailbreak-aanvallen die hun veiligheidsmechanismen omzeilen, waardoor ze schadelijke inhoud kunnen produceren, zoals instructies voor misdaden. Bedreigingsactoren gebruiken ook speciale black-hat LLM’s voor cybercriminaliteit. Verdedigingen omvatten gelaagde filtering, adversariële training en het verzamelen van crowdsourced aanvalsgegevens via projecten zoals Gandalf.
Jailbreaking is een vorm van prompt-injectie waarbij een aanvaller de LLM een rol toekent die de veiligheidstraining overruled. Een voorbeeld hiervan is een prompt genaamd SWILL, die op forums werd gedeeld en DeepSeek deed geloven dat het een ander model was zonder censuur, waarna het zonder problemen advies gaf over het vernietigen van vingerafdrukken en het vervalsen van valuta, hoewel het nog steeds weigerde te praten over het Tiananmen-incident. Jailbreaks werken omdat de veiligheid van LLM's geen aparte module is, maar deel uitmaakt van het aangeleerde gedrag van het model; een jailbreak creëert een sterke contextuele signaal dat de kansverdeling naar schadelijke outputs verschuift. Naast jailbreaks zijn er ook speciale black-hat-LLM's zoals WormGPT, EvilGPT, WolfGPT en DarkBERT, die specifiek zijn getraind voor cybercriminaliteit, hoewel veel ervan niet meer actief zijn of oplichting zijn. Verdedigingen omvatten architectonische scheiding van systeem- en gebruikersprompts, invoer-/uitvoerfilters zoals AVI (afstemmings-/overeenkomstvalidatie-interface) of Llama Guard, adversariële finetuning, constitutionele AI-afstemming, interne activeringsanalyse, RAG-gebaseerde bescherming en red teaming. Om realtime gegevens te verzamelen over jailbreaktechnieken lanceerde Lakera het Gandalf-project, een interactief spel waarin deelnemers gesimuleerde AI-toepassingen hacken om geheimen te achterhalen of schadelijk gedrag af te dwingen, met een leaderboard om de betrokkenheid te vergroten.
Bron: Habr — хаб ИИ —
origineel
