Tekoälyturvallisuus 🇺🇸 27.07.2026 02:04

Kuinka käänsin tekoälyn pimeälle puolelle: Systeemiset haavoittuvuudet johtavissa suurissa kielimalleissa

OpenAIOpenAI AnthropicAnthropic DeepSeekDeepSeek Google/DeepMindGoogle/DeepMind MetaMeta MicrosoftMicrosoft MistralMistral xAIxAI
Tutkija Dave Kuszmar löysi useita systeemisiä haavoittuvuuksia merkittävistä suurista kielimalleista, joiden avulla hän pystyi kiertämään turvatoimet ja saamaan vaarallisia ohjeita. Hyökkäykset toimivat lähes kaikissa suurissa kielimalleissa, paljastaen koko toimialaa koskevan tietoturvaongelman. Kuszmar vaatii käyttöönoton hidastamista, läpinäkyvyyden lisäämistä ja laajamittaista tutkimusta suurten kielimallien turvallisuudesta.
Tutkija Dave Kuszmar, entinen kyberturvallisuusjohtaja, havaitsi, että hän pystyi ohittamaan turvallisuusrajoituksia johtavissa suurissa kielimalleissa käyttämällä tekniikoita, kuten Time Bandit ja Inception. Time Bandit hyödyntää kielimallin kyvyttömyyttä tiedostaa nykyistä aikaa saadakseen sen toimimaan vanhentuneiden lakien mukaan, kun taas Inception käyttää sisäkkäisiä skenaarioita huijaamaan mallia tuottamaan haitallista tulostetta. Nämä hyväksikäytöt toimivat malleissa, kuten OpenAI:n GPT-4o, Anthropicin Claude, DeepSeek, Googlen Gemini, Metan Llama, Microsoftin Copilot, Mistralin Le Chat ja xAI:n Grok. Kuszmar sai ohjeet napalmin, metamfetamiinin ja jopa ydinaseiden uraanin rikastuslaitoksen valmistamiseen. Huolimatta haavoittuvuuksien ilmoittamisesta OpenAI:lle, CIA:lle, FBI:lle ja muille virastoille, hän sai vähän vastakaikua. Haavoittuvuudet vahvisti lopulta Bleeping Computer, ja ne raportoitiin Carnegie Mellonin yliopiston Ohjelmistotekniikan instituutin Tietokonetietotekniikan hätävalmiustyöryhmälle (Software Engineering Institute Computer Emergency Response Team, SEI CERT).
Lähde: IEEE Spectrum AI — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset