AI安全性 🇺🇸 30.07.2026 14:03

根本的な欠陥により大規模言語モデルが攻撃に対して脆弱に

OpenAIOpenAI AnthropicAnthropic Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek
研究者らは、大規模言語モデルにはハッキングに対して極めて脆弱になる根本的な欠陥があると主張している。LLMが指示の出所を識別する方法を悪用することで、攻撃者は薬物合成や航空機の破壊工作の指示など、禁止された情報を引き出すことができる。
独立研究者のチャールズ・イェ氏とジャスミン・クイ氏が国際機械学習会議で発表した論文は、大規模言語モデルに攻撃に対して脆弱な根本的な欠陥があることを明らかにしました。この欠陥は、LLMが誰または何から指示を受けているかを識別する方法に関係し、コカインの合成手順を提供したり、航空機の航法システムを妨害するといった、本来すべきでない行動をとるよう騙すことを容易にします。研究者らは、LLMがテキストの役割をタグではなくスタイルで識別するため、攻撃者が役割を偽装できることを発見しました。彼らはOpenAI、Anthropic、Alibaba、DeepSeekのモデルに対して思考連鎖偽装攻撃を実証しました。研究者らは、この問題は本質的に解決不可能であり、いかなる訓練量でも完全に対処できないと主張しています。彼らは、LLMが十分な基礎研究なしに重要なシステムに導入されていると警告しています。
出典: MIT Technology Review — 原文
関連記事 ↓
新着ニュース