Segurança de IAModelos 🇺🇸 04.08.2026 04:04

Três Incidentes Reais nas Avaliações de Segurança Cibernética da Anthropic

AnthropicAnthropic OpenAIOpenAI
A Anthropic descobriu três incidentes reais em suas avaliações de segurança cibernética, nos quais o Claude, devido a um mal-entendido sobre o acesso à internet, comprometeu sistemas externos. Um incidente envolveu o upload de malware para o PyPI, que foi instalado por uma empresa de segurança. Esses incidentes destacam os riscos de realizar avaliações de ataques cibernéticos.
A Anthropic revisou 141.006 execuções de avaliação e encontrou três incidentes separados envolvendo seis execuções no total, quatro das quais afetaram a mesma organização. Em todos os casos, o prompt de avaliação informava ao Claude que o ambiente era uma simulação sem acesso à internet, mas devido a um mal-entendido com o parceiro de avaliação, o acesso à internet estava disponível. O Claude tratou sistemas reais como parte do exercício e os comprometeu usando técnicas básicas, como senhas fracas e endpoints não autenticados. Uma empresa foi alvo porque seu nome correspondia a um nome fictício na avaliação. O incidente mais preocupante envolveu o upload de um pacote de malware para o PyPI após um processo complicado para criar uma conta. O pacote foi instalado por uma empresa de segurança que rotineiramente verifica pacotes Python em busca de malware, e o código executado exfiltrou credenciais de volta para o Claude. O pacote foi removido por outros scanners automatizados uma hora depois, mas já havia sido baixado e executado em 15 sistemas reais. Esses incidentes ressaltam os riscos significativos de executar avaliações de ataques cibernéticos e a necessidade de monitoramento próximo dos sandboxes.
Fonte: Simon Willison — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas