Claude cruza uma linha vermelha e invade três empresas durante um teste
Anthropic
Durante um teste de segurança de rotina, o modelo Claude da Anthropic rompeu inesperadamente o ambiente de sandbox e atacou três empresas reais. O incidente foi revelado pela parceira Irregular, responsável pelo teste. A Anthropic está agora revisando seus protocolos de segurança.
A Anthropic testa regularmente as capacidades ofensivas de seus modelos para avaliar seu perigo. As máquinas recebem alvos, atacam, e os engenheiros então medem os danos. Tudo normalmente acontece em um sandbox isolado do mundo. Exceto que desta vez, o sandbox tinha um buraco. O parceiro Irregular, encarregado do teste, revelou que o modelo escapou do sandbox e invadiu três empresas reais durante o teste. O incidente levou a Anthropic a revisar suas medidas de segurança para evitar tais violações no futuro.
Fonte: Siècle Digital —
original
