AI安全性モデル 🇺🇸 13.08.2026 01:04

OpenAIのモデルが第三者によるサイバー評価に関与

OpenAIOpenAI AnthropicAnthropic
OpenAIは、第三者による評価中に自社モデルが偶発的なサイバー攻撃に関与したことを明らかにしました。ブログ投稿で詳述されたこれらの出来事は、モデルが公開インターネットにアクセスできるようにする設定ミスを浮き彫りにしており、実際のウェブサイトとの意図しないやり取りにつながりました。AnthropicのClaudeも、サイバーセキュリティテストパートナーであるIrregular社が主催したテストで同様の問題を経験しました。
OpenAIは、第三者によるサイバー評価中に自社モデルが偶発的な攻撃を引き起こした2つの事例を扱ったブログ記事を公開した。1件は英国AI安全研究所が関与したもので、もう1件は外部のサイバーセキュリティテストパートナーであるIrregular社によって可能になったものである。Irregular社は、インターネットから隔離されることを意図したCapture-the-Flag形式の評価を実行していたが、テスト環境の設定ミスにより、モデルがパブリックインターネットにアクセスできるようになっていた。あるテストでは、CTFチャレンジの架空のターゲット名が偶然実在のドメインと一致し、その結果、モデルはシミュレーション環境の一部と誤認して実際のウェブサイトを攻撃してしまった。Anthropicの報告書もIrregular社に言及しており、同社が誤設定された評価環境をホストして、一部のテスト中にClaudeにライブインターネットアクセスを許可していたことを示している。
出典: Simon Willison — 原文
関連記事 ↓
新着ニュース