LLMの暗黒面:どのようにして武器にされ、なぜそうなるのか(そしてどう対処すべきか)
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
大規模言語モデル(LLM)は、安全性の仕組みを回避するジェイルブレイク攻撃に対して脆弱であり、犯罪の指示などの有害なコンテンツを生成する可能性があります。また、脅威アクターは、サイバー犯罪のために専用のブラックハットLLMも使用しています。防御策としては、多層的なフィルタリング、敵対的トレーニング、そしてGandalfのようなプロジェクトによるクラウドソーシング型の攻撃データ収集が挙げられます。
脱獄(ジェイルブレイク)は、攻撃者がLLMに安全性トレーニングを無効化する役割を与えるプロンプトインジェクションの一種です。例えば、SWILLと呼ばれるプロンプトがフォーラムで共有され、DeepSeekに検閲なしの別モデルであると信じ込ませた後、指紋の破壊や偽造通貨の作成に関するアドバイスを容易に提供しましたが、天安門事件に関する議論は依然として拒否しました。脱獄が機能するのは、LLMの安全性が独立したモジュールではなく、モデルの学習済み挙動の一部であり、脱獄によって強力な文脈信号が生成され、有害な出力への確率分布がシフトするためです。脱獄に加えて、WormGPT、EvilGPT、WolfGPT、DarkBERTのような専用のブラックハットLLMは、サイバー犯罪のために特別に訓練されていますが、その多くは廃止または詐欺です。防御策としては、システムプロンプトとユーザープロンプトのアーキテクチャ上の分離、AVI(整合性・合意検証インターフェース)やLlama Guardのような入出力フィルター、敵対的ファインチューニング、憲法AIアライメント、内部活性化分析、RAGベースの保護、レッドチーミングなどがあります。脱獄手法に関するリアルタイムデータを収集するため、LakeraはGandalfプロジェクトを立ち上げました。これは、参加者がシミュレートされたAIアプリケーションをハッキングして秘密を抽出したり有害な行動を強制したりするインタラクティブなゲームで、リーダーボードによりエンゲージメントを高めています。
出典: Habr — хаб ИИ —
原文
