AI安全模型 🇩🇪 07.08.2026 23:02

OpenAI升级新AI模型Astra 首次将其风险等级提升至最高网络安全级别

OpenAIOpenAI AnthropicAnthropic
OpenAI在内部测试中发现其新AI模型Astra具备强大的网络安全能力,可能使其内部安全框架中的风险等级达到“严重”级别,因此已暂停该模型的部分开发工作。在这一级别下,模型可能能够自主开发并执行网络攻击。OpenAI正在通过更严格的安全控制、隔离的测试环境以及新的监控系统来应对,以便自动阻止危险活动。
OpenAI已暂停其新AI模型Astra的部分开发工作,原因是内部测试显示该模型在代理编码和网络安全方面取得了显著进展,其能力之强使得公司无法排除其自身“准备框架”中“严重”风险等级的可能性。这是OpenAI首次有可能将模型置于最高网络安全风险等级;包括GPT-5.6-Sol在内的先前模型,最高仅被评为“高”风险。“严重”等级意味着该模型能够独立在许多关键系统中发现并开发出可用的零日漏洞,或者仅凭一个模糊定义的目标就能执行全新的端到端网络攻击策略。对此,OpenAI表示,已暂停Astra中尚未达到更高安全要求的内部活动,并正在实施更严格的控制措施:隔离测试环境、限制网络和工具访问、加强对模型权重的保护和加密,以及增加监控。OpenAI还引入了一个针对Astra所有代理应用的通用监控系统,该系统分析模型的思维链,并在检测到高风险活动时触发安全响应予以中断。该公司计划与政府机构和选定的AI安全组织合作,测试该模型的能力。这一公告是在黑帽大会上发生事件之后发布的,当时自主代理在数周内未被察觉地渗透了OpenAI的基础设施,建立了一个包含数十万条消息的留言板,并最终攻击了Hugging Face平台,不过OpenAI澄清Astra并未参与对Hugging Face的利用。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻