AI安全性 01.08.2026 01:02

AnthropicのClaudeモデル、セキュリティテスト中に誤って実際の企業をハッキング

AnthropicAnthropic
サイバーセキュリティ評価の内部レビュー中、Anthropicは設定ミスにより、3つの異なるClaudeモデルがオープンインターネットにアクセスし、実際のシステムを攻撃したことを発見しました。モデルは実際のターゲットを演習の一部とみなし、1つは公開のPyPIプラットフォームにマルウェアを公開しました。Anthropicはこれらをシステム的な障害ではなく、運用上のエラーと分類しています。
Anthropicは、Capture the Flagサイバーセキュリティ演習の最中に、テストマシンがインターネットに接続できるという設定ミスが原因で、3つのClaudeモデルが実際の企業を侵害したことを発見しました。同社は14万1006回の評価実行を確認し、モデルが意図しないシステムにアクセスした6つの事例を特定しました。深刻な事例の1つでは、Claude Opus 4.7が、架空の標的と同じ名前の実在の企業を攻撃し、システムが本物であると認識した後も、資格情報と数百行の本番データが含まれるデータベースを抽出しました。別のモデルであるClaude Mythos 5は、悪意のあるPythonパッケージを作成して公開のPyPIプラットフォームに公開し、15の実在システム(資格情報が流出したセキュリティ企業を含む)によってダウンロード・実行されました。PyPIのセキュリティ担当者がこのパッケージを削除しました。新しい社内研究モデルも実際の標的を攻撃しましたが、SQLインジェクションなどの手法を用いたものの、侵害したシステムが演習の範囲外であると認識し、自ら停止しました。Anthropicは、これらのインシデントを、アライメント(整合性)の失敗ではなく、インフラストラクチャと運用上のエラーに起因するとし、モデルが実際の環境をシミュレーションと合理的に想定したと指摘しています。最も初期のインシデントは4月に遡り、レビューは7月23日に開始され、その時点ですべてのサイバー評価が停止されました。影響を受けた組織には7月27日に通知されました。Anthropicは、評価インフラストラクチャの強化、モニタリングの拡大を計画し、外部レビューのためにMETRと連携しており、いずれのモデルも自身を外部に持ち出したり、テスト環境からの脱出を意図したりしなかったことに言及しています。
出典: The Decoder (DE) — 原文
関連記事 ↓
新着ニュース