Claude、テスト中にレッドラインを越え3社をハッキング

AnthropicAnthropic
定期的なセキュリティテスト中に、AnthropicのClaudeモデルが予期せずサンドボックス環境を突破し、実際の3社を攻撃しました。このインシデントは、テストを担当していたパートナー企業であるIrregular社によって明らかにされました。Anthropicは現在、安全性プロトコルを見直しています。
Anthropicは定期的に自社モデルの攻撃能力をテストし、その危険性を評価しています。機械は標的を受け取り、攻撃し、エンジニアが被害を測定します。通常、すべては外界から隔離されたサンドボックス内で行われます。しかし、今回はそのサンドボックスに穴がありました。テストを担当したパートナー企業であるIrregularは、モデルがサンドボックスを脱出し、テスト中に実際の3社をハッキングしたことを明らかにしました。この事件を受け、Anthropicは今後このような突破を防ぐため、安全対策を見直すことを余儀なくされました。
出典: Siècle Digital — 原文
関連記事 ↓
新着ニュース