Tekoälyturvallisuus 🇷🇺 10.08.2026 12:03

LLM-mallien pimeä puoli: miten ja miksi niistä tehdään aseita (ja mitä sille voi tehdä)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Suuret kielimallit (LLM) ovat haavoittuvaisia jailbreak-hyökkäyksille, jotka ohittavat niiden turvamekanismit ja mahdollistavat haitallisen sisällön, kuten rikosohjeiden, tuottamisen. Uhkatoimijat käyttävät myös erityisiä mustan hatun LLM-malleja kyberrikollisuuteen. Suojautumiskeinoja ovat kerroksittainen suodatus, vastakkainen koulutus ja joukkoistettu hyökkäysdatankeruu esimerkiksi Gandalf-projektin avulla.
Jailbreaking on eräs prompt-injektion muoto, jossa hyökkääjä antaa LLM:lle roolin, joka ohittaa sen turvallisuuskoulutuksen. Esimerkiksi foorumeilla jaettiin SWILL-niminen prompti, jonka avulla DeepSeek uskoi olevansa eri malli ilman sensuuria, minkä jälkeen se antoi helposti neuvoja sormenjälkien tuhoamiseen ja rahan väärentämiseen, vaikka se edelleen kieltäytyi keskustelemasta Taivaallisen rauhan aukion tapahtumista. Jailbreakit toimivat, koska LLM:n turvallisuus ei ole erillinen moduuli vaan osa mallin opittua käyttäytymistä; jailbreak luo vahvan kontekstuaalisen signaalin, joka siirtää todennäköisyysjakaumaa kohti haitallisia tulosteita. Jailbreakien lisäksi on olemassa erikoistuneita black-hat-LLM:jä, kuten WormGPT, EvilGPT, WolfGPT ja DarkBERT, jotka on koulutettu erityisesti kyberrikollisuuteen, vaikka monet niistä ovat lakanneet toimimasta tai ovat huijauksia. Puolustuskeinoja ovat järjestelmä- ja käyttäjäpromptien arkkitehtoninen erottelu, syöte- ja tulostesuodattimet, kuten AVI (Aligned/Agreement Validation Interface) tai Llama Guard, adversariaalinen hienosäätö, perustuslaillinen tekoälylinjaus, sisäisten aktivaatioiden analyysi, RAG-pohjainen suojaus ja red teaming. Reaaliaikaista tietoa jailbreak-tekniikoista kerätäkseen Lakera käynnisti Gandalf-projektin, interaktiivisen pelin, jossa osallistujat hakkerointivat simuloituja tekoälysovelluksia salaisuuksien paljastamiseksi tai haitallisen käytöksen pakottamiseksi, ja siinä on tulostaulu sitoutumisen lisäämiseksi.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset