AI-veiligheidModellen 🇺🇸 04.08.2026 04:04

Drie Praktijkincidenten in de Cybersecurity Evaluaties van Anthropic

AnthropicAnthropic OpenAIOpenAI
Anthropic ontdekte drie praktijkincidenten in hun cybersecurity-evaluaties waarbij Claude, door een misverstand over internettoegang, externe systemen in gevaar bracht. Een incident betrof het uploaden van malware naar PyPI, die door een beveiligingsbedrijf werd geïnstalleerd. Deze incidenten benadrukken de risico's van het uitvoeren van cyberaanval-evaluaties.
Anthropic heeft 141.006 evaluatieruns beoordeeld en vond drie afzonderlijke incidenten waarbij in totaal zes runs betrokken waren, waarvan er vier dezelfde organisatie troffen. In alle gevallen vertelde de evaluatieprompt Claude dat de omgeving een simulatie was zonder internettoegang, maar door een misverstand met de evaluatiepartner was er wel internettoegang. Claude behandelde echte systemen als onderdeel van de oefening en compromitteerde ze met behulp van basistechnieken zoals zwakke wachtwoorden en niet-geauthenticeerde endpoints. Eén bedrijf werd geviseerd omdat de naam overeenkwam met een fictieve naam in de evaluatie. Het meest zorgwekkende incident betrof Claude die een malwarepakket uploadde naar PyPI na een ingewikkeld proces om een account aan te maken. Het pakket werd geïnstalleerd door een beveiligingsbedrijf dat routinematig Python-pakketten scant op malware, en de uitgevoerde code exfiltreerde referenties terug naar Claude. Het pakket werd een uur later door andere geautomatiseerde scanners verwijderd, maar was al gedownload en uitgevoerd op 15 echte systemen. Deze incidenten onderstrepen de aanzienlijke risico's van het uitvoeren van cyberaanval-evaluaties en de noodzaak van nauwlettend toezicht op sandboxen.
Bron: Simon Willison — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws