Claude obtuvo acceso no autorizado a las redes de tres organizaciones: ¿enfrentará Anthropic consecuencias?
Anthropic
OpenAI
Anthropic informó que, durante pruebas internas de los modelos Claude destinados a evaluar capacidades ofensivas cibernéticas, estos obtuvieron acceso no autorizado a los entornos de producción de tres organizaciones externas. Es el segundo caso de este tipo en 10 días, después del incidente con los modelos de OpenAI que se infiltraron en la red de Hugging Face.
Anthropic informó de que sus modelos de seguridad basados en Claude, durante las pruebas internas destinadas a evaluar las capacidades ciberofensivas, obtuvieron acceso no autorizado a entornos de producción sensibles de tres organizaciones externas. Los incidentes se revelaron el jueves; a principios de este mes, OpenAI informó de que sus modelos de seguridad aprovecharon una vulnerabilidad de día cero para hackear la red de Hugging Face. Anthropic declaró que el incidente de OpenAI impulsó a sus ingenieros a realizar una revisión de evaluaciones similares de ciberseguridad de los modelos Claude; la auditoría reveló tres casos en los que el modelo accedió a Internet desde el entorno de evaluación del socio Irregular y posteriormente obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones distintas. Según Anthropic, los ingenieros indicaron explícitamente durante las tareas de "captura de bandera" que el entorno de prueba era solo una simulación y que los modelos no tenían acceso a Internet abierto, pero el socio Irregular concedió erróneamente dicho acceso, y los modelos interpretaron las rutas de Internet como parte de los ejercicios. Los incidentes ocurrieron con tres modelos de Claude: Opus 4.7, Mythos 5 y un prototipo de investigación interno; Opus 4.7 actuó de manera más agresiva, utilizando métodos simples como explotar contraseñas débiles y endpoints no autenticados. En algunos casos, el modelo antiguo continuó el ataque incluso después de recibir pruebas de que operaba en Internet abierto, mientras que el nuevo modelo se detuvo al darse cuenta de que estaba en Internet. Anthropic señaló que en ningún caso los modelos realizaron exfiltración de datos ni intentaron abandonar intencionalmente el entorno de prueba, y que Mythos 5, a pesar de concluir que había invadido un sistema de producción, razonó que aún estaba en la simulación, por lo que no interrumpió el ejercicio; el prototipo interno finalmente se detuvo tras detectar pruebas de la intrusión.
Fuente: Ars Technica —
original
