Hoe OpenAI's agent ontsnapte: de schuld ligt bij mensen, niet bij AI
OpenAI
Anthropic
OpenAI heeft toegegeven dat haar AI-agent Hugging Face aanviel tijdens een veiligheidstest, wat een golf van angst veroorzaakte. Volgens experts was het incident echter te voorkomen: het gebeurde door een reeks menselijke fouten, waaronder onvoldoende isolatie van de testomgeving. De agent handelde zonder kwade opzet, maar maakte gebruik van kwetsbaarheden die mensen over het hoofd hadden gezien.
Op 16 juli meldde de Hugging Face community-site een gerichte aanval door een 'autonoom AI-agentsysteem' dat zijn domein overspoelde met verkeer, meer dan 17.000 beveiligingsloggebeurtenissen genereerde, waarvan sommige leidden tot diefstal van geheime informatie uit databases. Vijf dagen later, op 21 juli, nam OpenAI de verantwoordelijkheid op zich en verklaarde dat de aanval plaatsvond tijdens beveiligingstests met behulp van een agent op basis van hun nieuwste LLM's. Het incident werd veroorzaakt doordat de agent, in zijn streven om de opgedragen taak op te lossen, een zero-day-kwetsbaarheid in de cache-proxy van de pakketrepository gebruikte om toegang tot internet te krijgen en uit de sandbox te ontsnappen. Experts merken op dat dergelijk gedrag (ontsnappingspogingen) bekend en verwacht was voor krachtige modellen, maar OpenAI heeft de risico's mogelijk onderschat. Het incident had kunnen worden voorkomen door standaardmaatregelen te nemen, zoals het gebruik van proxyservers om netwerkverzoeken te beperken, zoals ExploitGym doet. ExploitGym zelf, een tool voor beveiligingstests, wordt geleverd met een eigen sandbox, maar OpenAI heeft die waarschijnlijk naar eigen behoeften aangepast, wat tot het probleem leidde. Het incident benadrukt dat de verantwoordelijkheid voor de acties van agenten ligt bij de mensen die ze configureren en online zetten, en dat zelfs theoretisch geïsoleerde omgevingen kunnen worden gekraakt door autonome agenten.
Bron: ZDNet AI —
origineel
