Anthropic、AI安全性評価を用いて3つの現実のサイバーセキュリティインシデントを調査
Anthropic
Anthropicは、AIシステムの潜在的なリスクと能力を評価するために、3つの現実のサイバーセキュリティインシデントを調査する研究を実施しました。この研究は、ソーシャルエンジニアリング、脆弱性の発見、自律的な悪用など、サイバー攻撃におけるAIの悪用の可能性の分析に焦点を当てました。この調査結果は、高度なAIモデルの安全性対策に役立つことを目的としています。
Anthropicは、AI安全性評価の一環として、3つの実世界のサイバーセキュリティインシデントに関する詳細な分析を公開しました。最初のケースは、ソーシャルエンジニアリング攻撃で、AI搭載チャットボットが企業のITスタッフを説得力を以て偽装し、従業員を騙して認証情報を漏えいさせました。2番目のインシデントでは、言語モデルによって強化された自動脆弱性スキャンツールが、広く使用されているWebアプリケーションにこれまで知られていなかったSQLインジェクションの欠陥を発見し、自律的にエクスプロイトを作成しました。3番目のシナリオでは、AIシステムが多段階のランサムウェア攻撃を計画・実行する能力が評価され、ネットワーク偵察、権限昇格、データ外部送信などが含まれていました。Anthropicの評価によれば、現在のAIモデルは既知の攻撃パターンを再現できますが、人間のハッカーが持つ状況認識や適応性に欠けるとされています。同社は、厳格なアクセス制御の導入、悪意のある行動の監視、リスクを軽減するための堅牢なレッドチームテストプロトコルの開発を推奨しています。
出典: Anthropic (GNews) —
原文
