Como Eu Virei IA para o Lado Negro: Vulnerabilidades Sistêmicas nos Principais LLMs
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
O pesquisador Dave Kuszmar descobriu múltiplas vulnerabilidades sistêmicas nos principais LLMs, que permitiram contornar medidas de segurança e obter instruções perigosas. As explorações funcionaram em quase todos os grandes LLMs, revelando um problema de segurança em toda a indústria. Kuszmar pede desaceleração na implantação, aumento de transparência e pesquisa em larga escala sobre a segurança dos LLMs.
O pesquisador Dave Kuszmar, ex-diretor de cibersegurança, descobriu que conseguia contornar restrições de segurança em grandes modelos de linguagem (LLMs, na sigla em inglês) usando técnicas como Time Bandit e Inception. O Time Bandit explora a falta de consciência do LLM sobre o horário atual para fazê-lo operar sob leis desatualizadas, enquanto o Inception usa cenários aninhados para enganar o modelo e fazê-lo produzir resultados prejudiciais. Essas explorações funcionaram em modelos como GPT-4o da OpenAI, Claude da Anthropic, DeepSeek, Gemini do Google, Llama da Meta, Copilot da Microsoft, Le Chat da Mistral e Grok da xAI. Kuszmar conseguiu obter instruções para fabricar napalm, metanfetamina e até mesmo uma instalação de enriquecimento de urânio para armas nucleares. Apesar de relatar as vulnerabilidades para OpenAI, CIA, FBI e outras agências, recebeu pouca resposta. As vulnerabilidades foram eventualmente verificadas pelo Bleeping Computer e reportadas ao Computer Emergency Response Team (CERT) do Instituto de Engenharia de Software da Universidade Carnegie Mellon (SEI CERT).
Fonte: IEEE Spectrum AI —
original
