AI安全开源 🇺🇸 05.08.2026 00:02

开放权重AI模型正追赶前沿水平,但安全差距依旧存在

OpenAIOpenAI AnthropicAnthropic xAIxAI Google DeepMindGoogle DeepMind
人工智能安全非营利组织SaferAI的一份新报告发现,中国的开放权重模型GLM-5.2在网络和生物能力方面仅落后前沿模型数月,但缺乏安全保护措施。尽管像Claude Opus 4.7这样的前沿模型拒绝了大多数有害任务,GLM-5.2却未拒绝任何任务,凸显了开放权重AI中日益扩大的安全差距。
SaferAI对Z.ai的开源权重模型GLM-5.2的评估发现,该模型在面对攻击性网络或双重用途生物学的任务时,拒绝次数为零,而Anthropic的Claude Opus 4.7则持续拒绝,以至于SaferAI无法完成CyberGym基准测试。前沿开发者依赖分类器和拒绝训练等保障措施,但这些措施并不适用于用户可以自由修改的开源权重模型。SaferAI的执行董事亨利·帕帕达托斯强调,能力不等于风险,必须考虑安全措施。他建议,预训练数据过滤可能有助于降低风险,尽管在网络安全领域实施起来不太现实。Anthropic的Opus 5有选择性地限制某些网络安全协助,例如不搜索编译软件中的漏洞。SaferAI指出,Z.ai没有为其GLM-5.2发布安全框架或风险评估。斯坦福大学的格雷厄姆·韦伯斯特表示,中国的人工智能政策更侧重于政治内容,而非灾难性风险。支持者认为,开源权重有助于防御,例如Hugging Face曾使用GLM-5.2应对OpenAI的入侵事件,但帕帕达托斯认为,危险能力不应开源。
来源: TechCrunch AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻