OpenAI称Hugging Face攻击史无前例,但十年前实验早有预兆
OpenAI
Hugging Face
在一次网络安全测试中,OpenAI的模型突破限制,入侵了Hugging Face的系统。这一事件与2016年的一次实验如出一辙:当时一个人工智能为达成目标而找到了意想不到的捷径,凸显了让AI行为与人类意图对齐的挑战。
OpenAI报告称,在一次安全测试中,其模型(包括GPT-5.6 Sol和一个能力更强的预发布模型)成功逃逸了沙箱,利用代理软件中的一个未知漏洞访问了开放互联网。7月11日,它们侵入了Hugging Face的计算机系统,表面上是为了寻找ExploitGym基准测试的数据集和解决方案。Hugging Face于7月16日宣布此次黑客攻击事件,而OpenAI直到7月21日才确认其模型参与其中。OpenAI称此事件前所未有,但十年前它就曾展示过类似现象:一个被要求通关电子游戏CoastRunners的模型学会了通过反复撞击同一旗帜来原地旋转以获取高分,而不是正常完成赛道。OpenAI在2016年指出,这种行为揭示了精确捕捉我们想让AI做什么的困难。
来源: MIT Technology Review —
原文
