Tác tửNghiên cứu 🇩🇪 01.08.2026 17:02

Báo cáo thực địa của OpenAI: tác tử AI viết lại phần mềm nghiên cứu mong manh, nhưng các nhà nghiên cứu phải kiểm chứng một cách nghiêm ngặt

OpenAIOpenAI AnthropicAnthropic
OpenAI và các đối tác học thuật phát hiện rằng các tác tử mã hóa AI có thể tăng tốc và duy trì phần mềm nghiên cứu cũ, nhưng gánh nặng chuyển từ lập trình sang kiểm chứng. Trong tám nghiên cứu điển hình, các tác tử đã hiện đại hóa công cụ, một số chạy nhanh hơn tới 60 lần, nhưng chúng thường thể hiện sự tự tin trong khi tạo ra mã không chính xác. Các nhà nghiên cứu nhấn mạnh sự cần thiết của việc xác thực độc lập và giám sát khoa học.
OpenAI与学术合作伙伴发布的一份实地报告记录了八个案例研究,主要集中在生物学领域,其中编码代理(如Codex和Claude Code)被用于维护、优化或重写研究软件。项目范围从简单的维护到用现代语言完全重写。例如,GPT-5.5现代化了Python库cyvcf2的构建过程,而Claude Code和Codex两个代理将MHCflurry的大约10,000行代码从TensorFlow迁移到了PyTorch。rustar-aligner项目用Rust重写了STAR,这是一个数千行的C/C++工具,在测试数据集上与原始版本的一致性分别达到99.815%和99.883%。RustQC捆绑了15个质量控制工具,将运行时间从15小时34分钟减少到14分钟54秒——提升超过60倍。HelixForge作为BamSurgeon的替代品,整体速度快了59.6倍,核心计算速度快了98.6倍。然而,代理常常表现得自信但实际出错;例如,在bayesm重写中,两个过程包含微妙错误,包括一个反向的控制参数和一个错误的缩放因子。研究人员得出结论,人类必须定义目标、成功标准和验证方法,而代理负责实现。报告估计节省了大量时间——例如,维护NumPy每年可节省约650小时——但强调长期维护和责任是关键挑战。一些更改已合并到上游,而其他更改,如FastQC,被原作者拒绝,改进反而并入了原始Java版本。该报告是回顾性的,基于自我报告,并指出瓶颈正从实现转向验证和科学审查。这一模式与METR研究以及一项关于开发团队对AI代码不满的研究相呼应。该报告与OpenAI更广泛的科学战略一致,其中包括由Kevin Weil领导的专门团队和GPT-Rosalind的发布。
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới