AI-veiligheid 🇺🇸 29.07.2026 22:02

Sommige geavanceerde AI-modellen zijn schokkend eenvoudig te kraken, blijkt uit rapport

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Een nieuw rapport van FAR.AI onthult dat sommige toonaangevende AI-modellen met weinig kosten of moeite kunnen worden gekraakt. Grok was het meest kwetsbaar, terwijl Claude en GPT ongevoelig bleken voor de geteste aanvallen. De bevindingen onderstrepen de noodzaak van externe veiligheidsvoorschriften.
FAR.AI, een non-profitorganisatie voor AI-veiligheid, bouwde een tool die duizenden promptvariaties genereert om geavanceerde AI-modellen te jailbreaken. Ze testten modellen van Amerikaanse bedrijven: Anthropics Claude Opus 4.8 en Fable 5; OpenAIs GPT 5.5 en 5.6; Googles Gemini 3.1 Pro; en Grok 4.3 en 4.5 van SpaceXAI. Het rapport vond 448 jailbreaks voor Grok, 249 voor Gemini en geen voor Claude, Fable of GPT. De kosten om Grok te jailbreaken waren $58 en Gemini $278. FAR.AI-CEO Adam Gleave riep op tot verplichte veiligheidsnormen, en merkte op dat vrijwillige toezeggingen onvoldoende zijn. Google DeepMinds Rohin Shah betoogde dat de resultaten geen uitgebreide veiligheidsbeoordeling zijn. Anthropic en Google benadrukten voortdurende verbeteringen. Californië, New York en Illinois hebben wetten aangenomen die veiligheidsrapporten of audits door derden vereisen, maar er zijn geen federale vereisten. Het Witte Huis heeft om uitstel gevraagd voor sommige modelreleases. Deskundigen waarschuwen voor mogelijk misbruik op cyber-, bio- of chemisch gebied.
Bron: Wired AI — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws