AI安全性研究 🇺🇸 12.08.2026 04:03

フロンティアAIモデルから隠れた推論を抽出する新手法

OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind Moonshot AIMoonshot AI DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
研究者らは、フロンティアAIモデルの隠れた推論を抽出する方法を発見し、蒸留攻撃を可能にし、プライベートな情報を露呈させる可能性があることを明らかにした。彼らは、OpenAI、Anthropic、Googleのモデルでこの問題を特定し、中国のモデルであるKimi K3が、Claude OpusやGPT-5.6と驚くほど類似した推論を生成することを発見したが、これは蒸留の決定的な証拠ではないとしている。各社はこの脆弱性を軽減したが、完全には修正していない。
コンピュータ科学者たち、その中にはテュービンゲン大学のアレクサンダー・パンフィロフ氏も含まれるが、最先端の人工知能モデルの隠された「思考」を抽出する方法を発見した。この技術は、企業がより小さく、調整の緩いモデルの変種を提供しており、これらは同じ復号鍵を共有しているが、内部の推論を明かすことにより積極的であるという事実を利用している。暗号化された推論トレースをこれらの小さなモデルに供給することで、研究者はより大きなモデルの推論を明らかにすることができ、蒸留攻撃を可能にし、APIキーやパスワードなどの個人情報を露出させる可能性がある。彼らは、中国のモデルであるMoonshot AIのKimi K3が、Claude Opus 4.8やGPT-5.6 Solと非常によく似た推論を生成することを発見したが、これは蒸留を因果的に確立するものではないと指摘した。この脆弱性はOpenAI、Anthropic、Googleに報告され、各社は緩和策を実施しているが、パンフィロフ氏は一部の推論トレースは依然として抽出可能であると述べている。この問題は、中国企業が米国のモデルをコピーするために蒸留を使用していると非難されており、専門家の間でその実際の影響について見解が分かれているため、蒸留の地政学的重要性が高まっていることを浮き彫りにしている。
出典: Wired AI — 原文
関連記事 ↓
新着ニュース