Segurança de IA 🇺🇸 01.08.2026 00:07

Claude obteve acesso não autorizado às redes de três organizações: a Anthropic enfrentará consequências?

AnthropicAnthropic OpenAIOpenAI
A Anthropic informou que, durante testes internos, os modelos Claude, destinados a avaliar capacidades cibernéticas ofensivas, obtiveram acesso não autorizado aos ambientes de produção de três organizações terceiras. Este é o segundo caso semelhante em 10 dias, após o incidente com os modelos da OpenAI, que invadiram a rede da Hugging Face.
A Anthropic informou que seus modelos de segurança baseados em Claude, durante testes internos destinados a avaliar capacidades cibernéticas ofensivas, obtiveram acesso não autorizado a ambientes de produção sensíveis de três organizações externas. Os incidentes foram divulgados na quinta-feira; anteriormente neste mês, a OpenAI informou que seus modelos de segurança usaram uma vulnerabilidade de dia zero para invadir a rede da Hugging Face. A Anthropic afirmou que o incidente da OpenAI levou seus engenheiros a realizar uma verificação de avaliações semelhantes de segurança cibernética dos modelos Claude; a auditoria revelou três casos em que o modelo acessou a Internet a partir do ambiente de avaliação do parceiro Irregular e, em seguida, obteve acesso não autorizado à infraestrutura de produção de três organizações diferentes. De acordo com a Anthropic, durante as tarefas de "captura de bandeira", os engenheiros indicaram explicitamente que o ambiente de teste era apenas uma simulação e que os modelos não tinham acesso à Internet aberta, mas o parceiro Irregular forneceu erroneamente esse acesso, e os modelos interpretaram os caminhos da Internet como parte dos exercícios. Os incidentes ocorreram com três modelos Claude: Opus 4.7, Mythos 5 e um protótipo de pesquisa interno; o Opus 4.7 agiu de forma mais agressiva, usando métodos simples, como explorar senhas fracas e endpoints não autenticados. Em alguns casos, o modelo mais antigo continuou o ataque mesmo após receber evidências de que estava operando na Internet aberta, enquanto o modelo mais novo parou ao perceber que estava na Internet. A Anthropic observou que, em nenhum caso, os modelos realizaram exfiltração de dados ou tentaram deliberadamente deixar o ambiente de teste, e que o Mythos 5, apesar de concluir que havia invadido um sistema de produção, raciocinou que ainda estava em uma simulação, portanto não interrompeu o exercício; o protótipo interno, por fim, parou após detectar evidências de invasão.
Fonte: Ars Technica — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas