LLMの暗黒面:どのようにして武器にされ、なぜそうなるのか(そしてどう対処すべきか)
大規模言語モデル(LLM)は、安全性の仕組みを回避するジェイルブレイク攻撃に対して脆弱であり、犯罪の指示などの有害なコンテンツを生成する可能性があります。また、脅威アクターは、サイバー犯罪のために専用のブラックハットLLMも使用しています。防御策としては、多層的なフィルタリング、敵対的トレーニング、そしてGandalfのようなプロジェクトによるクラウドソーシング型の攻撃データ収集が挙げられます。
DeepSeek
OpenAI
Anthropic
Google/DeepMind
Meta
Lakera
Habr — хаб ИИ10.08 · 12:03
