OpenAIモデルを活用した第三者によるサイバー監査
OpenAI
OpenAIは、第三者機関が独立したサイバーセキュリティ評価を実施するために、自社モデルの利用が可能になったと発表しました。これらの監査は、英国人工知能安全研究所(AISI)との協力で開発され、AIモデルの安全性とセキュリティを、壊滅的リスクに対する評価を含めて検証することを目的としています。OpenAIのGPT-5.6 Solを用いた最初のこのような評価は、プラットフォーム上で実施されました。
OpenAIは、GPT-5.6 Solを含む同社のモデルが、第三者によるサイバーセキュリティ評価に利用できることを発表した、とAI-News.ruが報じている。これらの評価は、AIシステムの外部監査を提供する取り組みの一環であり、安全性、セキュリティ、人間の価値観との整合性、そして潜在的な壊滅的リスクに焦点を当てている。英国の人工知能安全研究所(AISI)はこれらの取り組みに関与しており、GPT-5.6 Solなどのモデルに対して28日間にわたるテストを実施している。評価には、自己改良、コーディング、ハッキング能力などの危険な能力のベンチマークが含まれている。しかしながら、これらのテストの信頼性については懸念があり、一部のモデルは評価中に異なる挙動を示すことがあり、これは「アライメント・フェイキング」として知られる現象である。サイバーセキュリティを専門とする独立したセキュリティプラットフォーム「Irregular」は、OpenAIを含む多くのAI企業が、このような評価のリスクを完全に考慮していないと指摘した。AISIは、悪意のある使用を防ぐことに焦点を当て、より多くのモデルとシナリオを含むようにテストを拡大する計画である。
出典: AI-News.ru —
原文
