AI安全研究 🇺🇸 12.08.2026 04:03

新方法提取前沿AI模型的隐藏推理过程

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
研究人员发现了一种方法,可以提取前沿AI模型的隐藏推理,这可能导致蒸馏攻击并泄露私人信息。他们在OpenAI、Anthropic和Google的模型中发现了这一问题,并发现中国模型Kimi K3产生的推理与Claude Opus和GPT-5.6极为相似,尽管这并非蒸馏的定论性证据。相关公司已缓解了这一漏洞,但尚未完全修复。
计算机科学家,包括来自蒂宾根大学的亚历山大·潘菲洛夫,发现了一种提取前沿AI模型隐藏‘思考’的方法。该技术利用了这样一个事实:公司提供较小的、对齐程度较低的模型变体,这些模型共享相同的解密密钥,但更愿意揭示内部推理。通过向这些较小的模型提供加密的推理轨迹,研究人员能够揭示较大模型的推理,从而可能促成蒸馏攻击,并暴露API密钥和密码等个人信息。他们发现,来自月之暗面的中国模型Kimi K3产生的推理与Claude Opus 4.8和GPT-5.6 Sol的推理惊人地相似,但他们指出这并不能因果性地确立蒸馏。该漏洞已报告给OpenAI、Anthropic和谷歌,这些公司已实施缓解措施,但潘菲洛夫表示,一些推理轨迹仍然可以被提取。这一问题凸显了蒸馏日益增长的地缘政治重要性,因为中国公司被指控利用蒸馏来复制美国模型,尽管专家们对其实际影响意见不一。
来源: Wired AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻