一部の最先端AIモデル、驚くほど簡単に脱獄可能との報告
Anthropic
OpenAI
Google/DeepMind
FAR.AIの新たな報告書によると、一部の主要なAIモデルは低コスト・低労力で脱獄可能であることが判明。Grokが最も脆弱で、ClaudeとGPTはテスト攻撃に対して耐性を示した。この結果は外部の安全規制の必要性を強調している。
AI安全の非営利団体FAR.AIは、最先端AIモデルを脱獄するために数千のプロンプトバリエーションを生成するツールを構築した。同団体は米国企業のモデル、すなわちAnthropicのClaude Opus 4.8とFable 5、OpenAIのGPT 5.5と5.6、GoogleのGemini 3.1 Pro、SpaceXAIのGrok 4.3と4.5をテストした。報告書では、Grokで448件、Geminiで249件の脱獄が確認され、Claude、Fable、GPTではゼロ件だった。Grokの脱獄にかかったコストは58ドル、Geminiは278ドルだった。FAR.AIのCEOであるアダム・グリーブ氏は、自主的な取り組みでは不十分であり、強制的な安全基準を求めた。Google DeepMindのロヒン・シャー氏は、この結果は包括的な安全性評価ではないと主張した。AnthropicとGoogleは継続的な改善を強調した。カリフォルニア、ニューヨーク、イリノイの各州は安全報告書または第三者監査を義務付ける法律を可決したが、連邦政府の要件は存在しない。ホワイトハウスは一部のモデルリリースの延期を要請している。専門家は、サイバー、生物、化学の領域での悪用の可能性に警告を発している。
出典: Wired AI —
原文
