Jotkin huippuluokan tekoälymallit ovat hämmästyttävän helppoja kiertää, raportti paljastaa
Anthropic
OpenAI
Google/DeepMind
FAR.AI:n uusi raportti paljastaa, että jotkin johtavat tekoälymallit voidaan kiertää pienellä kustannuksella tai vaivalla. Grok oli haavoittuvin, kun taas Claude ja GPT pysyivät immuuneina testatuille hyökkäyksille. Löydökset korostavat ulkoisten turvallisuussäädösten tarvetta.
FAR.AI, AI-turvallisuuteen keskittyvä voittoa tavoittelematon järjestö, rakensi työkalun, joka tuottaa tuhansia kehotevariaatioita eturivin tekoälymallien murtamiseksi. He testasivat yhdysvaltalaisten yritysten malleja: Anthropicin Claude Opus 4.8 ja Fable 5; OpenAI:n GPT 5.5 ja 5.6; Googlen Gemini 3.1 Pro; ja SpaceXAI:n Grok 4.3 ja 4.5. Raportissa havaittiin 448 murtamista Grokille, 249 Geminille eikä yhtään Claudelle, Fablelle tai GPT:lle. Grokin murtamisen kustannus oli 58 dollaria ja Geminin 278 dollaria. FAR.AI:n toimitusjohtaja Adam Gleave vaati pakollisia turvallisuusstandardeja ja totesi, että vapaaehtoiset sitoumukset eivät riitä. Google DeepMindin Rohin Shah väitti, että tulokset eivät ole kattava turvallisuusarviointi. Anthropic ja Google korostivat jatkuvia parannuksia. Kalifornia, New York ja Illinois ovat säätäneet lakeja, jotka edellyttävät turvallisuusraportteja tai kolmannen osapuolen auditointeja, mutta liittovaltiotason vaatimuksia ei ole. Valkoinen talo on pyytänyt viivytyksiä joidenkin mallien julkaisuun. Asiantuntijat varoittavat mahdollisesta väärinkäytöstä kyber-, bio- tai kemianaloilla.
Lähde: Wired AI —
Alkuperäinen
