智能体研究 🇩🇪 01.08.2026 17:02

OpenAI 实地报告:AI代理重写脆弱的研究软件,但研究人员必须严格验证

OpenAIOpenAI AnthropicAnthropic
OpenAI与学术合作伙伴发现,AI编程代理能够加速并维护老旧的研究软件,但负担从编程转向了验证。在八个案例研究中,代理实现了工具的现代化,有些运行速度快了60倍以上,然而它们常常表现得自信满满却产出错误的代码。研究人员强调需要独立验证和科学监督。
OpenAI与学术伙伴的一份实地报告记录了八个案例研究,主要集中在生物学领域,其中使用了诸如Codex和Claude Code等编码代理来维护、优化或重写研究软件。项目范围从简单的维护到用现代语言完全重写。例如,GPT-5.5使Python库cyvcf2的构建过程现代化,而两个代理,Claude Code和Codex,将大约10,000行MHCflurry代码从TensorFlow迁移到了PyTorch。rustar-aligner项目将STAR(一个数千行的C/C++工具)用Rust重写,在测试数据集上与原始版本的符合率分别达到了99.815%和99.883%。RustQC捆绑了15个质量控制工具,将运行时间从15小时34分钟缩短到14分钟54秒,提速超过60倍。HelixForge作为BamSurgeon的替代品,整体速度快了59.6倍,核心计算速度快了98.6倍。然而,代理们常常表现得自信满满但实际上出错;例如,在bayesm重写中,两个过程存在微妙错误,包括一个反相的控制参数和一个错误的缩放因子。研究人员得出结论,人类必须定义目标、成功标准和验证方法,而代理则负责实现。报告估计了显著的时间节省——例如,维护NumPy每年可节省约650小时——但强调长期维护和责任是关键挑战。一些变更被合并到了上游,而其他一些,如FastQC,则被原作者拒绝,导致改进被整合到了原始的Java版本中。这份报告是回顾性的,基于自我报告,并指出瓶颈正从实现转向验证和科学审查。这一模式在METR的一项研究和一项关于开发团队对AI代码不满的研究中得到了呼应。该报告符合OpenAI更广泛的科学战略,其中包括由Kevin Weil领导的专门团队以及GPT-Rosalind的发布。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻