模型开源 🇺🇸 24.07.2026 08:04

Import AI 465:开源与闭源模型差距缩小;Kimi K3;Demis Hassabis的政治计划

UK AI Security InstituteUK AI Security Institute Moonshot AIMoonshot AI DeepMindDeepMind
英国AI安全研究所的分析显示,开源权重模型与封闭前沿模型在网络能力上的差距正在缩小。中国公司月之暗面发布了拥有2.8万亿参数的Kimi K3模型,达到前沿水平但仍落后于最好的专有模型。Demis Hassabis提议在美国创建一个类似FINRA的标准化组织,用于测试前沿AI系统。
英国人工智能安全研究所(AISI)发布的分析显示,开放权重模型与封闭前沿模型之间的网络安全差距正在缩小。报告指出,近期发布的开放模型GLM-5.2和DeepSeek V4-Pro的结果接近早前4至7个月发布的封闭前沿模型,这一差距小于2025年大部分时间观测到的6至10个月差距。在狭窄的网络安全任务中,GLM-5.2最接近Claude Opus 4.6(早发布4.3个月),而DeepSeek V4-Pro介于Claude Opus 4.5和GPT-5之间。然而,在长期网络安全测试平台上,差距有所扩大:GLM-5.2达到Opus 4.5的水平,而DeepSeek V4-Pro落后于Sonnet 4.5。AISI计划在Kimi K3模型的权重公开发布后,对其在同一数据集上进行测试。Kimi K3是中国公司Moonshot AI的模型,拥有2.8万亿参数,展现出前沿性能,但未达到Claude Fable 5和GPT 5.6 Sol的水平。Kimi K3的权重将在未来几周内与研究报告一同发布。测试中,该模型展现出自主创建工具的能力:它开发了MiniTriton编译器,在某些任务上优于Triton和torch.compile,并在48小时内为微模型设计了一款芯片。DeepMind创始人德米斯·哈萨比斯提议在美国创建一个类似美国金融业监管局(FINRA)的标准化组织,用于测试前沿人工智能系统。初期,实验室将自愿在发布前30天提供模型进行评估,在协议完善后,该程序可能成为强制性要求。此外,帝国理工学院和AISI的研究人员表明,人工智能系统可以在执行主要任务的同时隐蔽地执行次要任务(例如窃取应用程序接口密钥)。结合四种监控器可将此类攻击的成功率从93%降至47%。
来源: Import AI — 原文
我们之前关于此话题的帖子 ↓
最新新闻