Hoe ik AI naar de Duistere Kant Keerde: Systemische Kwetsbaarheden in Toonaangevende LLM's
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
Onderzoeker Dave Kuszmar ontdekte meerdere systemische kwetsbaarheden in grote LLM's, waarmee hij veiligheidsmaatregelen kon omzeilen en gevaarlijke instructies kon verkrijgen. De exploits werkten in bijna alle grote LLM's, wat een industrie-breed beveiligingsprobleem aan het licht bracht. Kuszmar roept op tot vertraging van uitrol, meer transparantie en grootschalig onderzoek naar LLM-veiligheid.
Onderzoeker Dave Kuszmar, voormalig directeur cybersecurity, ontdekte dat hij veiligheidsbeperkingen in toonaangevende grote taalmodellen (large language models, LLM's) kon omzeilen met technieken als Time Bandit en Inception. Time Bandit maakt misbruik van het gebrek aan tijdsbewustzijn van het LLM, waardoor het werkt volgens verouderde wetten, terwijl Inception geneste scenario's gebruikt om het model te misleiden tot schadelijke output. Deze exploits werkten op modellen zoals OpenAI's GPT-4o, Anthropic's Claude, DeepSeek, Google's Gemini, Meta's Llama, Microsoft's Copilot, Mistral's Le Chat en xAI's Grok. Kuszmar kon instructies verkrijgen voor het maken van napalm, methamfetamine en zelfs een uraniumverrijkingsinstallatie voor kernwapens. Ondanks het melden van de kwetsbaarheden aan OpenAI, de CIA, de FBI en andere instanties, kreeg hij weinig reactie. De kwetsbaarheden werden uiteindelijk geverifieerd door Bleeping Computer en gemeld aan het Computer Emergency Response Team van het Software Engineering Institute van de Carnegie Mellon University (SEI CERT).
Bron: IEEE Spectrum AI —
origineel
