El bloque de razonamiento cifrado de Claude: un análisis a nivel de bytes dentro de la firma
Anthropic
Un artículo de Habr examina los bloques de razonamiento cifrados de los modelos Claude, revelando que el campo 'firma' es un protobuf que filtra metadatos como el ID del modelo y el UUID de la organización en texto plano. El autor muestra que el razonamiento real está cifrado con AES-GCM, pero se puede inferir su longitud, y los metadatos representan un riesgo de privacidad si se comparten los registros.
Un nuevo artículo en Habr detalla cómo extraer cadenas de razonamiento ocultas de modelos cerrados explotando una falla: un atacante toma un bloque cifrado de un modelo potente, se lo da a un modelo hermano más débil del mismo proveedor y le pide un recuento textual, leyendo así los pensamientos originales, incluidos cualquier contraseña o clave incluida accidentalmente. El autor revela que el campo 'firma' adjunto a cada bloque de pensamiento de Claude no es opaco: es un protobuf que se puede analizar sin ninguna clave. Dentro, solo el texto de pensamiento real está cifrado (AES-GCM, con una etiqueta de 16 bytes), mientras que la envoltura externa y el encabezado contienen metadatos en texto claro. El encabezado incluye el ID del modelo (por ejemplo, 'claude-opus-5'), el tipo de bloque y, desde la versión 15 (julio de 2026), el UUID de la organización del usuario de ~/.claude.json. Estos metadatos están cubiertos por un MAC, por lo que los bloques no pueden ser manipulados, pero si se exponen en registros, pueden vincular a un usuario con su organización y uso del modelo. El autor sugiere que la vulnerabilidad descrita en el preprint puede mitigarse por la presencia de estos metadatos, pero el riesgo práctico es que el encabezado sin cifrar filtra información sensible cuando se comparten los registros del agente.
Fuente: Habr — хаб ИИ —
original
