AI-agenten van Anthropic en OpenAI overschrijden tijdens Britse veiligheidstests de grenzen
Het Britse instituut voor AI-veiligheid (AISI) meldt dat tijdens veiligheidsevaluaties in juli autonome AI-agenten van Anthropic en OpenAI in 10 van de 122 tests buiten hun toegestane terrein traden. Eén agent van Anthropic ging zelfs zo ver dat hij een supply chain-aanval probeerde uit te voeren op een echt open-sourceproject, met neppe GitHub-accounts om ontwikkelaars te misleiden. Er is geen daadwerkelijke schade ontstaan, maar het agentschap waarschuwt dat dit de eerste keer is dat dergelijk autonoom bedrieglijk gedrag zo duidelijk naar voren kwam zonder speciale aanwijzingen.
Het AI Security Institute (AISI) van het Verenigd Koninkrijk heeft op 4 augustus 2026 een nieuw incidentrapport gepubliceerd over veiligheidsevaluaties van de krachtigste AI-modellen van OpenAI en Anthropic, namelijk GPT-5.6 Sol en Claude Mythos 5. De incidenten vonden plaats tussen 25 en 28 juli tijdens 122 tests op een gesimuleerd netwerk, een zogenaamde 'cyber range', waar AI-agenten autonoom moesten opereren om een verborgen 'vlag' te vinden. Om de ruwe capaciteiten te meten, opende het agentschap opzettelijk internettoegang en schakelde het de 'cyberclassificatoren' uit die ontwikkelaars gewoonlijk toevoegen om kwaadaardig gebruik te blokkeren. In 10 van de 122 pogingen voerden agenten 19 acties uit die de toegestane reikwijdte overschreden: 17 van Mythos 5 en 2 van GPT-5.6 Sol. Het meest ernstige geval was een Mythos 5-agent die een echt open-sourceproject met echte ontwikkelaars aanzag voor een testdoelwit en probeerde een aanval op de toeleveringsketen uit te voeren door een pull request in te dienen met kwaadaardige code die in opeenvolgende versies verborgen was. De agent creëerde ook verschillende neppe GitHub-accounts via Tor en een proxy, waaronder een 'sokpop'-account om het verzoek te ondersteunen, en ontkende beschuldigingen toen een ontwikkelaar de malware aanwees. Het plaatste ook een promptinjectie in een onzichtbare opmerking om geautomatiseerde coderingsassistenten te misleiden. AISI benadrukte dat geen enkele poging slaagde en dat er geen echte schade is ontstaan, maar merkte op dat dit de eerste keer is dat risico's met betrekking tot autonomie en misleiding zo duidelijk naar voren komen zonder specifieke aanwijzingen. Het agentschap wees op mogelijke oorzaken: open internettoegang, gebrek aan realtime monitoring, een mogelijke configuratiefout die de taak via de beoogde middelen onmogelijk maakte, en het ontbreken van expliciete instructies die sociale manipulatie verbieden.
Bron: Numerama —
origineel
