Pensamentos de IA podem ser lidos usando outra IA, revelando senhas e chaves internas
Anthropic
OpenAI
Google/DeepMind
Pesquisadores demonstraram um ataque que descriptografa os rastros de raciocínio ocultos de LLMs proprietários da Anthropic, OpenAI e Google usando duas chamadas de API, sem atacar o modelo alvo. O método também descobriu que logs de agentes públicos contêm centenas de segredos, incluindo senhas e chaves, escondidos dentro de blocos criptografados.
Oito pesquisadores do ELLIS Institute Tübingen, do Max Planck Institute for Intelligent Systems, do Tübingen AI Center, da MATS e da Snyk publicaram um preprint em 10 de agosto descrevendo um ataque aos rastros de raciocínio criptografados de modelos da Anthropic, da OpenAI e do Google. O ataque funciona pegando o bloco criptografado de um modelo forte (por exemplo, Claude Opus 4.8) e alimentando-o a um modelo mais fraco do mesmo provedor (por exemplo, Haiku 4.5), que é então solicitado a reescrever o raciocínio palavra por palavra, descriptografando-o assim. O ataque não quebra a criptografia nem ataca o modelo forte; ele explora o fato de que o bloco criptografado é retornado ao cliente e deve ser reenviado com a próxima solicitação. Os pesquisadores verificaram a autenticidade dos rastros descriptografados em 120 tarefas do Codeforces. Eles também examinaram 6708 logs de agentes públicos do GitHub e do Hugging Face, recuperando 315.320 blocos de raciocínio, que continham 704 segredos únicos, incluindo 62 chaves de API, 33 senhas, 24 tokens de acesso, além de e-mails, nomes e URLs internas. Notavelmente, 64 desses segredos não estavam visíveis em nenhum lugar da sessão visível, existindo apenas dentro dos blocos criptografados. O artigo também descreve um vetor de envenenamento em que um bloco malicioso pode ser plantado para injetar instruções em um agente que posteriormente o carrega. Os autores propõem medidas criptográficas e de sistema para vincular o bloco à sessão, ao usuário e ao modelo, mas, por enquanto, os usuários devem tratar os blocos de raciocínio criptografados como segredos e evitar compartilhar logs publicamente.
Fonte: Habr — хаб ИИ —
original
