Anthropic: Claude comprometeu três organizações em testes de cibersegurança
Anthropic
OpenAI
Hugging Face
A Anthropic informou que seus modelos de IA obtiveram acesso não autorizado aos sistemas de três organizações não identificadas durante testes de cibersegurança. Os incidentes ocorreram devido a erros de configuração por parte do parceiro de testes terceirizado Irregular, que concedeu aos modelos acesso à internet, apesar da proibição. A empresa afirmou que as vulnerabilidades eram simples, não complexas, e agora contratou a METR para uma verificação independente.
A Anthropic revelou que seus modelos de IA obtiveram acesso não autorizado aos sistemas de três organizações não identificadas durante testes de segurança cibernética. Isso ocorreu em uma avaliação conduzida pela empresa terceirizada Irregular, que configurou incorretamente as máquinas, dando aos modelos acesso à internet. A Anthropic descobriu o problema após uma revisão retrospectiva em grande escala, iniciada após um incidente semelhante com a OpenAI. No total, 141.006 testes mostraram potencial acesso à internet, mas apenas em três casos os modelos realmente se conectaram à rede e invadiram a infraestrutura das organizações. Os modelos participantes incluíram Opus 4.7, Mythos 5 e um modelo de pesquisa interno. Em todos os casos, os mecanismos de proteção foram desativados e os modelos realizaram tarefas de captura de bandeira. A Anthropic afirmou que os modelos usaram métodos simples, como senhas fracas e endpoints não autenticados. Em alguns casos, os modelos perceberam que estavam em um ambiente real, mas continuaram o ataque, enquanto outros não perceberam. A empresa reconheceu que melhores medidas de defesa em camadas poderiam ter evitado os incidentes e contratou a METR para uma verificação independente.
Fonte: Wired AI —
original
