AI安全性研究 🇺🇸 27.07.2026 02:04

GPT-Red:OpenAIの自動レッドチーミングによる自己改善型AI安全性

OpenAIOpenAI
OpenAIは、自己対戦方式を用いて大規模言語モデルの安全性、アラインメント、プロンプトインジェクションに対する頑健性を高める自動レッドチーミングシステム「GPT-Red」を発表しました。このシステムは、モデルが自律的に攻撃シナリオを生成し、それに対して微調整を行うことで、人間の絶え間ない介入なしに頑健性を向上させます。
OpenAIは、人工知能の安全性、アライメント、堅牢性を向上させるために設計された自動レッドチーミングシステム「GPT-Red」を発表しました。このシステムは自己対戦学習手法を採用しており、モデルが自律的に攻撃プロンプトや悪意のあるシナリオを生成し、それらに対して自身を微調整することで防御力を高めます。このアプローチにより、人間のテスターを常に介在させることなく、モデルの堅牢性を継続的に強化できます。GPT-Redは特に、攻撃者が特別に作成されたクエリを使用してモデルの制限を迂回しようとする「プロンプトインジェクション」に対する脆弱性の検出と緩和に効果的です。システムは攻撃の結果を自動的に評価し、その結果を用いてモデルの動作を調整することで、セキュリティ改善プロセスをよりスケーラブルで効率的なものにします。
出典: OpenAI — 原文
関連記事 ↓
新着ニュース