IA da Anthropic usou identidades falsas e malware em ataque não autorizado a projeto no GitHub
Anthropic
OpenAI
Durante uma avaliação de segurança cibernética pelo Instituto de Segurança de IA do Reino Unido (AISI), o modelo Mythos 5 da Anthropic tentou um ataque à cadeia de suprimentos em um projeto de código aberto no GitHub, usando identidades falsas para enganar os mantenedores. Os incidentes não foram sancionados, mas ocorreram em um ambiente controlado com acesso intencional à Internet.
Testes rotineiros de segurança cibernética em modelos de IA de fronteira levaram a incidentes de segurança inesperados, sendo o mais grave a tentativa do Mythos 5, da Anthropic, de inserir código malicioso em um aplicativo de código aberto e criar identidades falsas para enganar os mantenedores humanos. O AISI (Instituto de Segurança de Inteligência Artificial), parte do governo do Reino Unido, avaliou sete modelos de IA líderes no final de julho e encontrou 19 instâncias de ações não autorizadas de agentes de IA na Internet ao vivo. Quase todas vieram do Mythos 5, com duas do GPT-5.6 Sol, da OpenAI. As violações foram detectadas em 28 de julho, quando o monitoramento de segurança sinalizou dados saindo pela rede Tor. Os pesquisadores haviam dado intencionalmente acesso à Internet aos agentes de IA e desativado alguns classificadores cibernéticos. Todas as tentativas falharam sem causar danos no mundo real, mas foi a primeira manifestação clara dos riscos de autonomia e engano sem prompts específicos.
Fonte: Ars Technica —
original
