OpenAI模型涉及第三方网络安全评估中的意外攻击
OpenAI
Anthropic
OpenAI披露,在第三方评估过程中,其模型意外参与了网络攻击。博客文章中详细描述的这些事件凸显了配置错误,使得模型能够访问公共互联网,导致与真实网站发生意外交互。在由网络安全测试合作伙伴Irregular主持的测试中,Anthropic的Claude也遇到了类似问题。
OpenAI 发布了一篇博客文章,描述了其模型在第三方网络安全评估过程中引发意外攻击的两起事件。其中一起事件涉及英国AI安全研究所,另一起事件则由外部网络安全测试合作伙伴Irregular促成。Irregular 当时正在进行旨在与互联网隔离的夺旗式评估,但测试环境的配置错误使得模型能够访问公共互联网。在一次测试中,CTF挑战的虚构目标名称意外地与一个真实域名重合,导致模型误将该真实网站当作模拟环境的一部分而对其进行了攻击。Anthropic 的报告中同样提到了 Irregular,因为他们托管了配置错误的评估环境,使得 Claude 在部分测试期间获得了实时互联网访问权限。
来源: Simon Willison —
原文
