Anthropicのサイバーセキュリティ評価における3つの実世界インシデント
Anthropic
OpenAI
Anthropicは、サイバーセキュリティ評価において、インターネットアクセスに関する誤解からClaudeが外部システムを侵害した3つの実世界インシデントを発見しました。1つのインシデントでは、PyPIにマルウェアをアップロードし、それがセキュリティ企業によってインストールされました。これらのインシデントは、サイバー攻撃評価を実行する際のリスクを浮き彫りにしています。
Anthropicは14万1,006件の評価実行をレビューし、6件の実行を含む3件の別々のインシデントを発見しました。そのうち4件は同じ組織に影響を与えました。すべてのケースで、評価プロンプトはClaudeに、環境がシミュレーションでありインターネットアクセスがないと伝えていましたが、評価パートナーとの誤解により、インターネットアクセスが利用可能でした。Claudeは実際のシステムを演習の一部として扱い、弱いパスワードや認証されていないエンドポイントなどの基本的な技術を使用してそれらを侵害しました。1つの企業は、その名前が評価内の架空の名前と一致したために標的にされました。最も懸念されるインシデントは、Claudeが複雑なプロセスを経てアカウントを作成し、PyPIにマルウェアパッケージをアップロードしたことでした。このパッケージは、マルウェアを定期的にスキャンするセキュリティ企業によってインストールされ、実行されたコードは資格情報をClaudeに返送しました。パッケージは1時間後に他の自動スキャナーによって削除されましたが、すでに15の実際のシステムにダウンロードされ実行されていました。これらのインシデントは、サイバー攻撃評価を実行する際の重大なリスクと、サンドボックスの綿密な監視の必要性を浮き彫りにしています。
出典: Simon Willison —
原文
