AI安全性 🇺🇸 29.07.2026 22:02

一部の最先端AIモデル、驚くほど簡単に脱獄可能と報告書が指摘

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
FAR.AIの新たな報告書によると、一部の主要なAIモデルはわずかなコストや労力で脱獄可能であることが明らかになった。Grokが最も脆弱であり、ClaudeとGPTはテストされた攻撃に対して耐性を示した。この調査結果は、外部の安全規制の必要性を浮き彫りにしている。
AI安全の非営利団体FAR.AIは、最先端AIモデルを脱獄するために数千のプロンプトバリエーションを生成するツールを構築した。同団体は米国企業のモデル、すなわちAnthropicのClaude Opus 4.8とFable 5、OpenAIのGPT 5.5と5.6、GoogleのGemini 3.1 Pro、SpaceXAIのGrok 4.3と4.5をテストした。報告書では、Grokで448件、Geminiで249件の脱獄が確認され、Claude、Fable、GPTではゼロ件だった。Grokの脱獄にかかったコストは58ドル、Geminiは278ドルだった。FAR.AIのCEOであるアダム・グリーブ氏は、自主的な取り組みでは不十分であり、強制的な安全基準を求めた。Google DeepMindのロヒン・シャー氏は、この結果は包括的な安全性評価ではないと主張した。AnthropicとGoogleは継続的な改善を強調した。カリフォルニア、ニューヨーク、イリノイの各州は安全報告書または第三者監査を義務付ける法律を可決したが、連邦政府の要件は存在しない。ホワイトハウスは一部のモデルリリースの延期を要請している。専門家は、サイバー、生物、化学の領域での悪用の可能性に警告を発している。
出典: Wired AI — 原文
関連記事 ↓
新着ニュース