Segurança de IA 🇷🇺 11.08.2026 22:01

Bloqueio de Raciocínio Criptografado do Claude: Uma Análise em Nível de Byte da Assinatura

AnthropicAnthropic
Um artigo do Habr examina os blocos de raciocínio criptografados dos modelos Claude, revelando que o campo 'assinatura' é um protobuf que vaza metadados como ID do modelo e UUID da organização em texto claro. O autor mostra que o raciocínio real é criptografado com AES-GCM, mas seu comprimento pode ser inferido, e os metadados representam um risco à privacidade se os logs forem compartilhados.
Um novo artigo no Habr detalha como extrair cadeias de raciocínio ocultas de modelos fechados por meio de uma falha: um atacante pega um bloco criptografado de um modelo forte, entrega-o a um modelo irmão mais fraco do mesmo provedor e pede uma releitura literal, lendo assim os pensamentos originais, incluindo senhas ou chaves eventualmente incluídas. O autor revela que o campo 'assinatura' anexado a cada bloco de raciocínio do Claude não é opaco: é um protobuf que pode ser analisado sem nenhuma chave. Dentro, apenas o texto real do raciocínio é criptografado (AES-GCM, com um tag de 16 bytes), enquanto o envelope externo e o cabeçalho contêm metadados em texto simples. O cabeçalho inclui o ID do modelo (por exemplo, 'claude-opus-5'), o tipo de bloco e, desde a versão 15 (julho de 2026), o UUID da organização do arquivo ~/.claude.json do usuário. Esses metadados são cobertos por um MAC, portanto os blocos não podem ser adulterados, mas, se expostos em logs, podem vincular um usuário à sua organização e ao uso de modelos. O autor sugere que a vulnerabilidade descrita no preprint pode ser mitigada pela presença desses metadados, mas o risco prático é que o cabeçalho não criptografado vaza informações sensíveis quando os logs do agente são compartilhados.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas