ロシアのLLMに対するOWASP LLM10(無制限消費攻撃)のテスト
Яндекс
Сбер
AIレッドチームプロジェクトの研究者らは、ロシアの代表的なモデルであるYandexGPT Lite 5とGigaChat Liteを、OWASP LLM10:無制限消費攻撃に対してテストしました。彼らは、再帰的なコンテキスト拡張、フラクタルネスティング、組み合わせ爆発、マルチエージェントシミュレーションを引き起こすために特別に作られたプロンプトを使用し、計算負荷を増加させることを目指しました。この研究は、従来の防御策ではこのようなリソース枯渇攻撃に対して不十分であることを強調しています。
この記事は、OWASP LLM10(無制限な消費)カテゴリについて論じています。このカテゴリは、言語モデルに過剰に大きな計算量を強制し、リソース枯渇やサービス拒否を引き起こす攻撃に焦点を当てています。研究者らは、再帰的コンテキスト拡張(クワイン風の再帰)、フラクタル入れ子、計算爆発、意味論的組み合わせ爆発、マルチエージェントシミュレーション、グリッチトークン悪用など、さまざまな攻撃クラスを表す悪意のあるプロンプトを用意しました。これらのプロンプトは、モデルに過度に長い応答を生成させたり、数千のエンティティをシミュレートさせたり、自身の推論を再帰的に分析させたりすることができ、その一方で正当なユーザーリクエストのように見えます。この研究では、ロシアの代表的な2つの大規模言語モデル、YandexGPT Lite 5とGigaChat Liteを、2000以上の悪意のあるプロンプトをサポートするAIレッドチームのウェブサービス(そのうち200はOWASP LLM10をターゲットにしています)を用いてテストしました。評価には、大規模言語モデルを審判とする手法と手動検証が用いられました。この記事は、キーワードフィルタリングなどの従来のセキュリティ対策は効果がなく、より堅牢なアーキテクチャレベルの防御策の必要性を強調しています。
出典: Habr — хаб ИИ —
原文
