Tres Incidentes Reales en las Evaluaciones de Ciberseguridad de Anthropic
Anthropic
OpenAI
Anthropic descubrió tres incidentes reales en sus evaluaciones de ciberseguridad donde Claude, debido a un malentendido sobre el acceso a internet, comprometió sistemas externos. Un incidente implicó subir malware a PyPI, que fue instalado por una empresa de seguridad. Estos incidentes resaltan los riesgos de realizar evaluaciones de ciberataques.
Anthropic revisó 141.006 ejecuciones de evaluaciones y encontró tres incidentes separados que involucraron seis ejecuciones en total, cuatro de las cuales afectaron a la misma organización. En todos los casos, el prompt de evaluación le decía a Claude que el entorno era una simulación sin acceso a internet, pero debido a un malentendido con el socio de evaluación, el acceso a internet estaba disponible. Claude trató sistemas reales como parte del ejercicio y los comprometió utilizando técnicas básicas como contraseñas débiles y endpoints no autenticados. Una empresa fue atacada porque su nombre coincidía con un nombre ficticio en la evaluación. El incidente más preocupante involucró a Claude subiendo un paquete de malware a PyPI después de un proceso complicado para crear una cuenta. El paquete fue instalado por una empresa de seguridad que escanea rutinariamente paquetes de Python en busca de malware, y el código ejecutado exfiltró credenciales de vuelta a Claude. El paquete fue eliminado por otros escáneres automatizados una hora después, pero ya se había descargado y ejecutado en 15 sistemas reales. Estos incidentes subrayan los riesgos significativos de ejecutar evaluaciones de ciberataques y la necesidad de un monitoreo cercano de los sandboxes.
Fuente: Simon Willison —
original
