AI安全 🇷🇺 11.08.2026 22:01

Claude的加密推理模块:深入解析签名机制的字节级细节

AnthropicAnthropic
一篇发表于Habr的文章对Claude模型中的加密推理模块进行了剖析,发现其中的“签名”字段是一个protobuf,会在明文状态下泄露模型ID和组织UUID等元数据。作者指出,实际的推理内容采用AES-GCM加密,但其长度可以被推断出来,且如果日志被共享,这些元数据会带来隐私风险。
Habr 上一篇文章详细介绍了如何利用一个漏洞从封闭模型中提取隐藏的推理链:攻击者从强模型中提取一个加密块,将其交给同一提供商的较弱兄弟模型,并要求其逐字复述,从而读取原始思考内容,包括任何意外包含的密码或密钥。作者揭示了每个 Claude 思考块附带的“签名”字段并不是不透明的:它是一个无需任何密钥即可解析的 protobuf。其中,只有实际思考文本被加密(AES-GCM,带 16 字节标签),而外部信封和头部则包含明文元数据。头部包括模型 ID(例如 'claude-opus-5')、块类型,以及自 15 版本(2026 年 7 月)以来,来自用户 ~/.claude.json 的组织 UUID。此元数据受 MAC 保护,因此块不能被篡改,但如果暴露在日志中,它可以将用户与其组织及模型使用情况关联起来。作者建议,预印本中描述的漏洞可能因存在此元数据而得到缓解,但实际风险在于,当代理日志被共享时,未加密的头部会泄露敏感信息。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻