AI安全性 🇺🇸 29.07.2026 22:02

最先端AIモデル、米FAR.AIの報告書で脆弱性露呈——一部は驚くほど簡単に脱獄可能

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
FAR.AIの新たな報告書によると、一部の主要なAIモデルは少ないコストや労力で脱獄(ジェイルブレイク)可能であることが判明。Grokが最も脆弱で、ClaudeとGPTはテストした攻撃に対して耐性を示した。この結果は、外部による安全性規制の必要性を浮き彫りにしている。
AI安全の非営利団体FAR.AIは、最先端AIモデルを脱獄するために数千のプロンプトバリエーションを生成するツールを構築した。同団体は米国企業のモデル、すなわちAnthropicのClaude Opus 4.8とFable 5、OpenAIのGPT 5.5と5.6、GoogleのGemini 3.1 Pro、SpaceXAIのGrok 4.3と4.5をテストした。報告書では、Grokで448件、Geminiで249件の脱獄が確認され、Claude、Fable、GPTではゼロ件だった。Grokの脱獄にかかったコストは58ドル、Geminiは278ドルだった。FAR.AIのCEOであるアダム・グリーブ氏は、自主的な取り組みでは不十分であり、強制的な安全基準を求めた。Google DeepMindのロヒン・シャー氏は、この結果は包括的な安全性評価ではないと主張した。AnthropicとGoogleは継続的な改善を強調した。カリフォルニア、ニューヨーク、イリノイの各州は安全報告書または第三者監査を義務付ける法律を可決したが、連邦政府の要件は存在しない。ホワイトハウスは一部のモデルリリースの延期を要請している。専門家は、サイバー、生物、化学の領域での悪用の可能性に警告を発している。
出典: Wired AI — 原文
関連記事 ↓
新着ニュース