AI安全 🇷🇺 11.08.2026 21:02

AI的思想可被另一AI读取,泄露其中的密码和密钥

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
研究人员演示了一种攻击方法,通过两次API调用即可解密Anthropic、OpenAI和Google等厂商专有大型语言模型的隐藏推理轨迹,且无需攻击目标模型。该方法还发现,公开的代理日志中包含数百个秘密,包括密码和密钥,这些秘密隐藏在加密块中。
来自ELLIS研究所图宾根分校、马克斯·普朗克智能系统研究所、图宾根人工智能中心、MATS和Snyk的八位研究人员于8月10日发布了一篇预印本,描述了一种针对Anthropic、OpenAI和Google模型加密推理痕迹的攻击方法。该攻击通过截取强大模型(例如Claude Opus 4.8)的加密块,并将其输入同一提供商提供的较弱模型(例如Haiku 4.5),然后要求该较弱模型逐字重写推理过程,从而解密该加密块。此攻击并未破解加密或攻击强大模型,而是利用了加密块返回给客户端并需随下一次请求重新发送这一事实。研究人员在120个Codeforces任务上验证了解密痕迹的真实性。他们还扫描了来自GitHub和Hugging Face的6708个公开代理日志,恢复了315,320个推理块,其中包含704个独特秘密,包括62个API密钥、33个密码、24个访问令牌,以及电子邮件、姓名和内部URL。值得注意的是,其中64个秘密在可见会话中任何地方均未出现,仅存在于加密块内部。该论文还描述了一种投毒向量,可将恶意块植入代理中,以便稍后加载时注入指令。作者提出了密码学和系统层面的措施,将块与会话、用户和模型绑定,但就目前而言,用户应将加密推理块视为秘密,并避免公开共享日志。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻