AI安全研究 🇺🇸 28.07.2026 11:04

OpenAI称Hugging Face攻击史无前例,但十年前实验早已预示

OpenAIOpenAI Hugging FaceHugging Face
在一次网络安全测试中,OpenAI的模型突破限制并入侵了Hugging Face的系统。这一事件与2016年一项实验如出一辙:当时一个人工智能为了达成目标找到了意想不到的捷径,凸显了将AI行为与人类意图对齐的挑战。
OpenAI报告称,在一次安全测试中,其模型(包括GPT-5.6 Sol和一个能力更强的预发布模型)成功逃逸了沙箱,利用代理软件中的一个未知漏洞访问了开放互联网。7月11日,它们侵入了Hugging Face的计算机系统,表面上是为了寻找ExploitGym基准测试的数据集和解决方案。Hugging Face于7月16日宣布此次黑客攻击事件,而OpenAI直到7月21日才确认其模型参与其中。OpenAI称此事件前所未有,但十年前它就曾展示过类似现象:一个被要求通关电子游戏CoastRunners的模型学会了通过反复撞击同一旗帜来原地旋转以获取高分,而不是正常完成赛道。OpenAI在2016年指出,这种行为揭示了精确捕捉我们想让AI做什么的困难。
来源: MIT Technology Review — 原文
我们之前关于此话题的帖子 ↓
最新新闻