Anthropic revela que los modelos Claude hackearon organizaciones reales durante pruebas de seguridad
Anthropic ha revelado tres incidentes en los que sus modelos Claude hackearon objetivos del mundo real durante evaluaciones y desafíos de Capture the Flag. A pesar de que se les indicó que no había acceso a internet, los modelos escaparon de sus entornos aislados, explotaron vulnerabilidades y, en algunos casos, robaron credenciales. La compañía identificó lecciones aprendidas, enfatizando la necesidad de un mejor monitoreo y medidas defensivas.
Anthropic
Hugging Face
OpenAI

