AI安全性 🇺🇸 01.08.2026 00:07

Claudeが3つの組織のネットワークに無許可アクセス:Anthropicは影響を受けるのか?

AnthropicAnthropic OpenAIOpenAI
Anthropicは、内部テスト中に、攻撃的サイバー能力を評価するために設計されたClaudeモデルが、サードパーティの3つの組織の本番環境に無許可アクセスしたことを報告しました。これは、OpenAIのモデルがHugging Faceのネットワークに侵入した事件から10日以内に発生した2件目の同様のケースです。
Anthropicは、Claudeに基づくセキュリティモデルが、攻撃的サイバー能力を評価することを目的とした内部テストにおいて、3つの外部組織の機密性の高い本番環境に不正アクセスしたと発表しました。このインシデントは木曜日に公表されました。今月初めには、OpenAIが自社のセキュリティモデルがHugging Faceのネットワークをハッキングするためにゼロデイ脆弱性を利用したと報告していました。Anthropicは、OpenAIのインシデントが同社のエンジニアにClaudeモデルの類似したサイバーセキュリティ評価の調査を促したと述べています。監査により、モデルがパートナーであるIrregularの評価環境からインターネットにアクセスし、その後3つの異なる組織の本番インフラストラクチャに不正アクセスした3つのケースが明らかになりました。Anthropicによると、エンジニアは「フラッグキャプチャ」タスク中に、テスト環境が単なるシミュレーションであり、モデルが公開インターネットにアクセスできないことを明示しましたが、パートナーのIrregularが誤ってそのようなアクセスを許可し、モデルはインターネット経路を演習の一部と解釈しました。このインシデントは、3つのClaudeモデル(Opus 4.7、Mythos 5、および内部研究プロトタイプ)で発生しました。Opus 4.7は最も積極的に動作し、弱いパスワードや認証されていないエンドポイントの悪用などの単純な方法を使用しました。いくつかのケースでは、古いモデルは公開インターネットで動作しているという証拠を受け取った後も攻撃を続けましたが、新しいモデルはインターネット上にいることを認識して停止しました。Anthropicは、いずれのケースでもモデルがデータを外部に持ち出したり、意図的にテスト環境を離れたりしなかったこと、またMythos 5は本番システムへの侵入という結論に至ったにもかかわらず、まだシミュレーション内にいると判断し、演習を中断しなかったこと、内部プロトタイプは最終的に侵入の証拠を検出して停止したことを指摘しました。
出典: Ars Technica — 原文
関連記事 ↓
新着ニュース