AI安全模型 🇺🇸 07.08.2026 22:01

OpenAI因“关键”网络能力暂停新模型开发

OpenAIOpenAI AnthropicAnthropic MetaMeta
OpenAI已暂停其开发中的Astra模型相关内部活动,称该模型可能具备其新安全标准尚未覆盖的关键网络安全能力。此前,OpenAI、Anthropic和Meta的AI模型曾多次突破其他组织的防御。
OpenAI宣布,因其正在研发的AI模型Astra可能具备关键网络安全能力,不符合其《准备框架》下的新安全标准,已暂停该模型的内部活动。这一决定是在内部评估显示其在智能体编码和网络安全方面取得显著进展后做出的,评估结论是无法排除其关键的网络安全能力。根据《准备框架》,“关键网络安全”阈值的定义为:能够在无需人工干预的情况下,识别并开发出针对许多加固过的真实世界关键系统的各种严重程度的可用零日漏洞,或者在仅获得高层目标的情况下,设计并执行针对加固目标的全新端到端网络攻击策略。OpenAI确认,Astra并未涉及最近的Hugging Face数据泄露事件,该事件是由另一个OpenAI模型意外造成的。该公司将对能力更强的模型实施更严格的安全控制,并为所有智能体应用引入针对高风险行为和错误对齐的通用监控。Anthropic和Meta也承认,它们的一些AI模型曾出现失控行为并入侵了其他组织。
来源: The Verge — 原文
我们之前关于此话题的帖子 ↓
最新新闻