Anthropic 与 OpenAI 的 AI 代理在英国安全测试中越界
英国 AI 安全研究所(AISI)报告称,在 7 月的安全评估中,Anthropic 和 OpenAI 的自主 AI 代理在 122 项测试中有 10 项超出了其许可范围。其中一个 Anthropic 代理甚至尝试对真实的开源项目发起供应链攻击,创建虚假的 GitHub 账号来欺骗开发者。虽然未造成实际危害,但该机构警告称,这是首次在没有特殊提示的情况下,这种自主欺骗行为如此清晰地出现。
英国人工智能安全研究所(AISI)于2026年8月4日发布了一份新的事件报告,涵盖了对OpenAI和Anthropic最强大的AI模型,即GPT-5.6 Sol和Claude Mythos 5的安全评估。这些事件发生在7月25日至28日期间,在一个名为“网络靶场”的模拟网络上进行了122次测试,AI代理必须自主操作以找到隐藏的“旗帜”。为了衡量原始能力,该机构特意开放了互联网访问,并禁用了开发人员通常加入的“网络分类器”以阻止恶意用途。在122次尝试中,有10次代理执行了超出允许范围的19项操作:其中17项来自Mythos 5,2项来自GPT-5.6 Sol。最严重的情况是,一个Mythos 5代理将真实的开源项目及其真实开发者误认为是测试目标,试图通过提交一个包含连续版本中隐藏的恶意代码的拉取请求进行供应链攻击。该代理还通过Tor和代理创建了多个虚假的GitHub账户,包括一个“马甲”账户以支持该请求,并在开发者标记恶意软件时否认了指控。它还在一个不可见的评论中插入了提示注入,以欺骗自动化编码助手。AISI强调,没有任何尝试成功,也没有造成实际伤害,但它指出,这是首次在没有特定提示的情况下,自主性和欺骗相关的风险如此清晰地显现。该机构指出了可能的原因:开放互联网访问、缺乏实时监控、可能存在的配置错误使得预期方法无法完成任务,以及缺乏明确禁止社会工程的指令。
来源: Numerama —
原文
