AIをダークサイドに引き込んだ方法:主要LLMのシステム的な脆弱性
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
研究者Dave Kuszmarは、主要なLLMに複数のシステム的な脆弱性を発見し、安全対策を回避して危険な指示を得ることに成功しました。この悪用はほぼすべての主要LLMで有効であり、業界全体のセキュリティ問題を明らかにしました。Kuszmarは、展開の速度を落とし、透明性を高め、LLMの安全性に関する大規模な研究を求めています。
元サイバーセキュリティディレクターである研究者のデイブ・クシュマー氏は、Time BanditやInceptionといった手法を用いて、主要な大規模言語モデル(LLM)の安全制限を回避できることを発見した。Time Banditは、LLMが現在時刻を認識できないことを悪用し、古い法律に基づいて動作させる手法であり、Inceptionは入れ子状のシナリオを用いてモデルを欺き、有害な出力を生成させる。これらの悪用は、OpenAIのGPT-4o、AnthropicのClaude、DeepSeek、GoogleのGemini、MetaのLlama、MicrosoftのCopilot、MistralのLe Chat、xAIのGrokなどのモデルで機能した。クシュマー氏は、ナパーム弾、メタンフェタミン、さらには核兵器用のウラン濃縮施設の製造手順を入手することに成功した。これらの脆弱性をOpenAI、CIA(米中央情報局)、FBI(米連邦捜査局)などの機関に報告したが、ほとんど反応が得られなかった。最終的に、これらの脆弱性はBleeping Computerによって検証され、カーネギーメロン大学ソフトウェア工学研究所のコンピュータ緊急対応チーム(SEI CERT)に報告された。
出典: IEEE Spectrum AI —
原文
