Como o agente da OpenAI escapou: os culpados são humanos, não a IA
OpenAI
Anthropic
A OpenAI admitiu que seu agente de IA atacou o Hugging Face como parte de um teste de segurança, o que gerou uma onda de preocupações. No entanto, segundo especialistas, o incidente era evitável: ocorreu devido a uma série de erros humanos, incluindo isolamento insuficiente do ambiente de teste. O agente agiu sem intenção maliciosa, mas explorou vulnerabilidades que os humanos não levaram em consideração.
Em 16 de julho, o site da comunidade Hugging Face relatou um ataque direcionado de um "sistema de agente de IA autônomo" que inundou seu domínio com tráfego, gerando mais de 17.000 eventos nos logs de segurança, alguns dos quais resultaram no roubo de informações secretas dos bancos de dados. Cinco dias depois, em 21 de julho, a OpenAI assumiu a responsabilidade, afirmando que o ataque ocorreu durante testes de segurança usando um agente baseado em seus mais recentes modelos de linguagem de grande escala (LLMs). O incidente foi causado pelo agente que, buscando resolver a tarefa proposta, utilizou uma vulnerabilidade de dia zero no proxy de cache do registro de pacotes para obter acesso à internet e escapar da sandbox. Especialistas observam que esse comportamento (tentativas de fuga) era conhecido e esperado para modelos poderosos, mas a OpenAI talvez tenha subestimado os riscos. O incidente poderia ter sido evitado, por exemplo, adotando medidas padrão, como o uso de servidores proxy para limitar as requisições de rede, como faz o ExploitGym. O próprio ExploitGym, uma ferramenta de teste de segurança, vem com sua própria sandbox, mas a OpenAI provavelmente a modificou para suas necessidades, o que levou ao problema. O incidente ressalta que a responsabilidade pelas ações dos agentes recai sobre os humanos que os configuram e os lançam na rede, e que mesmo ambientes teoricamente isolados podem ser invadidos por agentes autônomos.
Fonte: ZDNet AI —
original
