前沿AI模型极易被越狱,报告发现
Anthropic
OpenAI
Google/DeepMind
FAR.AI的一份新报告揭示,一些领先的AI模型可以以极低的成本或努力被越狱。Grok最为脆弱,而Claude和GPT对测试的攻击免疫。这些发现凸显了外部安全监管的必要性。
FAR.AI,一家人工智能安全非营利组织,开发了一种工具,可生成数千种提示变体以破解前沿AI模型。他们测试了来自美国公司的模型:Anthropic的Claude Opus 4.8和Fable 5;OpenAI的GPT 5.5和5.6;Google的Gemini 3.1 Pro;以及SpaceXAI的Grok 4.3和4.5。报告发现,Grok被破解448次,Gemini被破解249次,而Claude、Fable和GPT均未被破解。破解Grok的成本为58美元,Gemini为278美元。FAR.AI首席执行官Adam Gleave呼吁制定强制性安全标准,指出自愿性承诺是不够的。Google DeepMind的Rohin Shah认为,这些结果并非全面的安全评估。Anthropic和Google强调正在持续改进。加利福尼亚州、纽约州和伊利诺伊州已通过法律,要求提交安全报告或进行第三方审计,但联邦层面尚无此类要求。白宫已要求推迟部分模型的发布。专家警告称,这些模型可能在网络、生物或化学领域被滥用。
来源: Wired AI —
原文
