Criptografia Contornada: Como Modelos de IA Expõem Facilmente Dados Sensíveis dos Usuários
Anthropic
OpenAI
Google/DeepMind
Pesquisadores alemães encontraram uma maneira de extrair dados sensíveis, como senhas e chaves de API, de chatbots de IA explorando os "logs de raciocínio" criptografados usados por modelos como ChatGPT, Claude e Gemini. O ataque funciona copiando esses logs e usando-os com versões mais antigas ou modificadas dos modelos da mesma empresa, quebrando efetivamente a criptografia. A equipe descriptografou mais de 315.000 logs, revelando 62 chaves de API, 33 senhas e outras informações pessoais.
Pesquisadores da Alemanha publicaram um artigo intitulado 'Stealing Reasoning Traces from Proprietary LLM APIs' demonstrando como modelos de IA da Anthropic, OpenAI e Google podem vazar dados sensíveis de usuários. Ao realizar tarefas de raciocínio, esses modelos geram uma string criptografada chamada 'log de raciocínio' que é enviada de volta ao servidor a cada nova resposta para fornecer contexto. Os pesquisadores descobriram que logs de raciocínio podem ser copiados e usados em outros modelos da mesma empresa, incluindo versões mais antigas ou modificadas. Se um modelo modificado tiver suas medidas de segurança removidas via jailbreak, ele pode decodificar a criptografia dos logs. Usando 6.708 repositórios públicos do GitHub e Hugging Face, eles conseguiram descriptografar 315.320 logs de raciocínio, que continham 62 chaves de API, 33 senhas, 24 tokens de acesso, 30 endereços de e-mail pessoais e nomes/endereços de mantenedores de projetos. Muitos desses detalhes estavam presentes apenas nos logs de raciocínio, não em outras partes da sessão de chat. O especialista em segurança Voldemaras Kadys, da Cybernews, observa que a criptografia não foi quebrada no sentido tradicional; em vez disso, o compartilhamento de rastros de raciocínio criptografados entre modelos compatíveis permite que modelos mais fracos se tornem uma chave mestra para descriptografia. Ele aconselha tratar logs de raciocínio como dados sensíveis e nunca compartilhá-los.
Fonte: t3n —
original
