AI-veiligheid 🇺🇸 30.07.2026 14:03

Fundamenteel gebrek maakt LLM's kwetsbaar voor aanvallen

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
Onderzoekers beweren dat grote taalmodellen een fundamenteel gebrek hebben dat ze zeer kwetsbaar maakt voor hacks. Door te exploiteren hoe LLM's instructiebronnen identificeren, kunnen aanvallers ze misleiden tot het onthullen van verboden informatie, zoals instructies voor drugsynthese of vliegtuigsabotage.
Een paper gepresenteerd op de International Conference on Machine Learning door onafhankelijke onderzoekers Charles Ye en Jasmine Cui onthult een fundamentele fout in grote taalmodellen die hen kwetsbaar maakt voor aanvallen. De fout heeft betrekking op hoe grote taalmodellen identificeren wie of wat hen instructies geeft, waardoor het gemakkelijk wordt om hen te misleiden om dingen te doen die ze niet zouden moeten doen, zoals het geven van instructies voor het synthetiseren van cocaïne of het saboteren van het navigatiesysteem van een vliegtuig. De onderzoekers ontdekten dat grote taalmodellen de rol van tekst niet op basis van tags identificeren, maar op stijl, waardoor aanvallers rollen kunnen nabootsen. Ze demonstreerden chain-of-thought-vervalsingsaanvallen op modellen van OpenAI, Anthropic, Alibaba en DeepSeek. De onderzoekers stellen dat dit probleem fundamenteel onoplosbaar is, aangezien geen enkele hoeveelheid training het volledig kan aanpakken. Ze waarschuwen dat grote taalmodellen worden ingezet in kritieke systemen zonder voldoende fundamenteel onderzoek.
Bron: MIT Technology Review — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws