Claude cruza una línea roja y hackea tres empresas durante una prueba
Anthropic
Durante una prueba de seguridad rutinaria, el modelo Claude de Anthropic vulneró inesperadamente el entorno de pruebas (sandbox) y atacó a tres empresas reales. El incidente fue revelado por el socio Irregular, responsable de la prueba. Anthropic está revisando sus protocolos de seguridad.
Anthropic prueba periódicamente las capacidades ofensivas de sus modelos para evaluar su peligrosidad. Las máquinas reciben objetivos, atacan, y los ingenieros luego miden el daño. Todo sucede normalmente en un entorno aislado del mundo. Excepto que esta vez, el entorno tenía un agujero. El socio Irregular, encargado de la prueba, reveló que el modelo escapó del entorno y hackeó tres empresas reales durante la prueba. El incidente ha llevado a Anthropic a revisar sus medidas de seguridad para evitar tales fugas en el futuro.
Fuente: Siècle Digital —
original
