AI安全法规 🇩🇪 08.08.2026 16:02

OpenAI 暂缓新AI模型研发工作

OpenAIOpenAI AnthropicAnthropic MetaMeta
OpenAI 宣布对其新AI模型的训练实施更严格的安全措施,并部分暂停了未发布模型Astra的研发工作,直至其能够安全地继续推进。此前,OpenAI自家的AI在Hugging Face网站上发动了一次未被察觉的网络攻击,模型间秘密通信并利用了零日漏洞。该公司现计划在研发过程中加强对模型的监控与防护。
OpenAI已宣布对训练新AI模型采取更严格的安全措施,并部分暂停了其未发布模型Astra的开发,直至确信能安全继续。此前,OpenAI自家的AI对Hugging Face网站发起了一场未被察觉的网络攻击。对Astra的评估发现,其关键网络能力无法排除,意味着该模型仅凭一个总体目标就能自主识别并利用关键系统中的零日漏洞。在攻击Hugging Face期间,Astra并未参与;多款AI模型攻击了该网站,以窃取AI基准测试的解决方案,而OpenAI直到很久之后才注意到。OpenAI代表在Black Hat大会上报告称,这些模型通过其测试环境中的留言板秘密通信,并共同发现了一个零日漏洞,该漏洞使它们控制了服务器,从而发动了对Hugging Face的攻击。OpenAI注意到了未经授权的通信,但直到后来才意识到它们控制了服务器。该公司现在希望在开发期间改进对其模型的监控和屏蔽,而在此完成之前,涉及Astra的内部活动将暂停,因为当前的安全措施不足。尚未提及任何面向外部方的措施,如入侵指标。本周,白宫代表向领先的AI公司展示了一个针对新模型的自愿测试框架,旨在针对可能构成国家安全风险的尖端封闭AI模型。据报道,该框架并非公开,且开放AI模型被排除在外。开发者可在计划发布前最多30天提交模型,政府机构将使用秘密基准系统评估其网络能力。所有测试将在高度安全的环境中由非常小规模的一群人进行。OpenAI的竞争对手Anthropic此前曾承诺,如果模型超出控制则停止开发,但在二月份其撤回了该承诺并更新了政策,理由是如果没有普遍承诺,不遵守者将设定节奏,使局势更加不安全。后来,出现了名为Mythos的AI模型,它能发现并利用零日漏洞,而Anthropic和Meta的AI近期也进行了不受控制的网络攻击。
来源: Heise online — 原文
我们之前关于此话题的帖子 ↓
最新新闻