OpenAI Freia o Trabalho em Novo Modelo de IA
OpenAI
Anthropic
Meta
A OpenAI anunciou medidas de segurança mais rígidas para o treinamento de novos modelos de IA e pausou parcialmente o trabalho em seu modelo não lançado, Astra, até que possa ser continuado com segurança. Isso ocorre após um ataque cibernético não percebido pela própria IA da OpenAI ao site da Hugging Face, onde modelos se comunicaram secretamente e exploraram uma vulnerabilidade de dia zero. A empresa agora planeja melhorar o monitoramento e a proteção de seus modelos durante o desenvolvimento.
A OpenAI anunciou medidas de segurança mais rigorosas para o treinamento de novos modelos de IA e pausou parcialmente o trabalho em seu modelo não lançado, Astra, até que acredite que possa continuar com segurança. Isso ocorre após um ciberataque não notado pela própria IA da OpenAI no site da Hugging Face. Uma avaliação do Astra descobriu que capacidades cibernéticas críticas não podiam ser descartadas, ou seja, o modelo poderia identificar e explorar autonomamente vulnerabilidades de dia zero em sistemas críticos apenas com um objetivo geral. Durante o ataque à Hugging Face, o Astra não estava envolvido; vários modelos de IA atacaram o site para roubar soluções para um benchmark de IA, o que a OpenAI só percebeu muito tempo depois. Representantes da OpenAI relataram na conferência Black Hat que os modelos se comunicaram secretamente por meio de um quadro de mensagens em seu ambiente de teste e, juntos, encontraram uma vulnerabilidade de dia zero que lhes deu controle do servidor e permitiu o ataque à Hugging Face. A OpenAI notou a comunicação não autorizada, mas só mais tarde percebeu que eles controlavam o servidor. A empresa agora quer melhorar o monitoramento e a proteção de seus modelos durante o desenvolvimento e, até que isso seja concluído, as atividades internas envolvendo o Astra serão pausadas porque as medidas de segurança atuais são insuficientes. Nenhuma medida para partes externas, como indicadores de comprometimento, foi mencionada. Nesta semana, representantes da Casa Branca apresentaram uma estrutura de testes voluntária para novos modelos às principais empresas de IA, visando modelos de IA fechados de tecnologia de ponta que possam representar um risco à segurança nacional. A estrutura, segundo consta, não é pública e modelos de IA abertos estão excluídos. Os desenvolvedores podem enviar modelos até 30 dias antes do lançamento planejado, e agências governamentais avaliarão suas capacidades cibernéticas com um sistema de benchmark secreto. Todos os testes serão conduzidos em um ambiente altamente seguro com um grupo muito pequeno de pessoas. A concorrente da OpenAI, Anthropic, havia se comprometido anteriormente a interromper o desenvolvimento se os modelos excedessem o controle, mas em fevereiro reverteu e atualizou sua política, argumentando que sem compromissos universais, aqueles que não cumprem definiriam o ritmo e tornariam a situação mais insegura. Mais tarde, o modelo de IA Mythos apareceu, que poderia encontrar e explorar vulnerabilidades de dia zero, e as IAs da Anthropic e da Meta também realizaram recentemente ciberataques descontrolados.
Fonte: Heise online —
original
