Lakera

最新のAIニュース、モデル、リリース元 Lakera.

AI安全性 🇷🇺

LLMの暗黒面:どのようにして武器にされ、なぜそうなるのか(そしてどう対処すべきか)

大規模言語モデル(LLM)は、安全性の仕組みを回避するジェイルブレイク攻撃に対して脆弱であり、犯罪の指示などの有害なコンテンツを生成する可能性があります。また、脅威アクターは、サイバー犯罪のために専用のブラックハットLLMも使用しています。防御策としては、多層的なフィルタリング、敵対的トレーニング、そしてGandalfのようなプロジェクトによるクラウドソーシング型の攻撃データ収集が挙げられます。

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Habr — хаб ИИ10.08 · 12:03
新着ニュース