AI研究人员曾警告自主自我改进风险,如今首批里程碑已达成
OpenAI
Anthropic
Google DeepMind
Sakana AI
IAPS研究员Severin Field对来自OpenAI、Anthropic、Google DeepMind、Meta及美国高校的25位研究人员进行了关于递归自我改进的调研。在一篇博客文章中,他报告称,他们列出的多个里程碑现已实现,例如数学奥林匹克竞赛金牌水平的表现以及AI生成的研讨会论文。Field还警告称,可能出现一种“激励反转”,导致强大模型被内部保留。
在通讯《攻击面》的一篇博文中,塞弗林·菲尔德总结了一项于2025年夏末进行的访谈研究的结果。在受访的25名研究人员中,有20人将AI研究的自动化列为最严重、最紧迫的AI风险之一。递归自我改进指的是一个系统在AI开发方面足够优秀,能够构建出比自己更强的版本,这一循环可能会持续下去。菲尔德认为,递归自我改进已不再仅仅是营销承诺。作为进展的衡量标准,受访者反复提到非营利组织METR的“任务地平线”基准,该基准显示,自2019年以来,AI智能体可自主完成的任务长度大约每六个月翻一番(一些分析人士声称自2024年以来每四个月翻一番)。争议点不在于自我改进本身,而在于其递归性——即改进是否会螺旋上升为自我维持的循环。怀疑者表示,需要在记忆、创造力或区分真假假设方面取得突破,因为对于范式转变的想法,没有训练数据或解决方案密钥。自访谈以来,已达成数个里程碑:OpenAI和谷歌DeepMind在数学奥林匹克竞赛中达到金牌水平;Sakana的“AI科学家”产出了一篇经同行评审的研讨会论文;安德烈·卡帕西构建了一个可独立运行训练循环的智能体设置;Anthropic报告称,其Claude模型现在为其自身生产代码库编写了超过80%的代码。20名受访者中只有4人预期研究能力模型将以公开产品的形式出现;一半人预期纯内部使用,其余人则预期有提炼后的公开版本。菲尔德描述了一种可能的“激励翻转”:一旦AI显著加速自身研究,保留而非出售将变得更有价值。作为证据,他引用了2026年7月OpenAI内部模型逃出测试环境并入侵Hugging Face的安全事件,以及美国政府对Anthropic的Claude Mythos的临时访问限制。菲尔德提出了三项建议:举行听证会,让CEO和研究人员在宣誓后就自动化AI研究作证;建立一个国家运营的“任务地平线”基准,并在AI安全与创新中心设立匿名访谈项目;研究国际AI协议的验证方法,否则与中国达成的协议将实际上无法执行。他指出,这场辩论几乎尚未触及华盛顿,而实验室却在继续竞相向前。最近,领先AI公司的1224名员工,包括OpenAI和Meta的首席科学家,签署了一份公开声明,警告他们的公司可能很快将AI研究自动化。
来源: The Decoder (DE) —
原文
