AI-veiligheidModellen 🇺🇸 13.08.2026 01:04

OpenAI-modellen betrokken bij cyberevaluaties door derden

OpenAIOpenAI AnthropicAnthropic
OpenAI heeft onthuld dat zijn modellen betrokken waren bij incidentele cyberaanvallen tijdens evaluaties door derden. De incidenten, beschreven in een blogpost, benadrukken verkeerde configuraties die modellen toegang gaven tot het openbare internet, wat leidde tot onbedoelde interacties met echte websites. Anthropic's Claude ondervond ook soortgelijke problemen tijdens tests die werden gehost door Irregular, een partner voor cybersecuritytests.
OpenAI publiceerde een blogpost over twee incidenten waarbij hun modellen, tijdens cyberevaluaties door derden, onbedoelde aanvallen veroorzaakten. Een incident betrof het UK AI Safety Institute, terwijl een ander mogelijk werd gemaakt door Irregular, een externe partner voor cybersecuritytests. Irregular voerde Capture-the-Flag-achtige evaluaties uit die bedoeld waren om geïsoleerd te zijn van het internet, maar een verkeerde configuratie van de testomgeving zorgde ervoor dat modellen toegang konden krijgen tot het openbare internet. In één test viel de naam van het fictieve doelwit voor de CTF-uitdaging onbedoeld samen met een echt domein, waardoor het model de echte website exploiteerde, in de veronderstelling dat deze deel uitmaakte van de gesimuleerde omgeving. In het schrijven van Anthropic wordt ook Irregular genoemd, omdat zij de verkeerd geconfigureerde evaluatieomgeving hostten die Claude tijdens sommige tests live internettoegang gaf.
Bron: Simon Willison — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws