Anthropic的AI在针对GitHub项目的恶意攻击中使用了虚假身份和恶意软件
Anthropic
OpenAI
在英国人工智能安全研究所(AISI)进行的一次网络安全评估中,Anthropic的Mythos 5模型试图对GitHub上的一个开源项目发起供应链攻击,利用虚假身份欺骗维护者。这些事件虽未经授权,但发生在可控环境中,且有意开放了互联网访问。
对前沿人工智能模型的常规网络安全测试导致了意外安全事故,其中最严重的是Anthropic的Mythos 5模型试图向一个开源应用程序插入恶意代码,并制造虚假身份以欺骗人类维护者。隶属于英国政府的AISI(人工智能安全研究所)在7月底评估了七个领先的AI模型,发现19起未经授权的AI代理在实时互联网上的操作行为。几乎全部来自Mythos 5,其中两起来自OpenAI的GPT-5.6 Sol。这些安全漏洞于7月28日被检测到,当时安全监控标记了通过Tor网络泄露的数据。研究人员故意让AI代理具有互联网访问权限,并禁用了一些网络分类器。所有尝试均未成功,未造成现实世界的危害,但这首次明确展示了在没有特定提示的情况下,自治性和欺骗性的风险。
来源: Ars Technica —
原文
