OpenAI 현장 보고서: AI 에이전트가 취약한 연구 소프트웨어를 재작성하지만, 연구자들은 엄격한 검증을 해야 한다
OpenAI
Anthropic
OpenAI와 학계 파트너들은 AI 코딩 에이전트가 오래된 연구 소프트웨어를 가속화하고 유지보수할 수 있지만, 부담이 프로그래밍에서 검증으로 옮겨간다는 사실을 발견했습니다. 여덟 가지 사례 연구에서 에이전트는 도구를 현대화했으며, 일부는 60배 이상 빠르게 실행되기도 했지만, 종종 잘못된 코드를 생성하면서도 자신감 있게 행동했습니다. 연구자들은 독립적인 검증과 과학적 감독의 필요성을 강조합니다.
OpenAI와 학술 파트너들이 작성한 현장 보고서는 주로 생물학 분야에서 Codex 및 Claude Code와 같은 코딩 에이전트가 연구 소프트웨어를 유지보수, 최적화 또는 재작성하는 데 사용된 8개의 사례 연구를 문서화합니다. 프로젝트는 단순한 유지보수에서 현대 언어로의 완전한 재작성까지 다양했습니다. 예를 들어, GPT-5.5는 Python 라이브러리 cyvcf2의 빌드 프로세스를 현대화했고, 두 에이전트인 Claude Code와 Codex는 MHCflurry의 약 10,000줄을 TensorFlow에서 PyTorch로 마이그레이션했습니다. rustar-aligner 프로젝트는 수천 줄의 C/C++ 도구인 STAR를 Rust로 재작성하여 테스트 데이터 세트에서 원본과 99.815% 및 99.883% 일치를 달성했습니다. 15개의 품질 관리 도구를 묶은 RustQC는 실행 시간을 15시간 34분에서 14분 54초로 줄여 60배 이상의 속도 향상을 이루었습니다. BamSurgeon을 대체하는 HelixForge는 전체적으로 59.6배, 핵심 계산은 98.6배 더 빨랐습니다. 그러나 에이전트는 종종 확신에 차 있지만 틀릴 수 있었습니다. 예를 들어, bayesm 재작성에서 두 절차에 미묘한 오류가 있었는데, 여기에는 반전된 제어 매개변수와 잘못된 스케일링 요인이 포함되었습니다. 연구자들은 인간이 목표, 성공 기준, 검증 방법을 정의해야 하며 에이전트는 구현을 담당해야 한다고 결론지었습니다. 보고서는 상당한 시간 절약(예: NumPy 유지보수 시 연간 약 650시간 절약)을 추정하지만, 장기적인 유지보수와 책임을 주요 과제로 강조합니다. 일부 변경 사항은 업스트림에 병합된 반면, FastQC와 같은 다른 변경 사항은 원저자에 의해 거부되어 개선 사항이 대신 원본 Java 버전에 통합되었습니다. 이 보고서는 회고적이며 자체 보고에 기반하고 있으며, 병목 현상이 구현에서 검증 및 과학적 검토로 이동하고 있다고 지적합니다. 이러한 패턴은 METR 연구와 개발자 팀의 AI 코드에 대한 불만에 대한 연구에서도 반향을 일으킵니다. 이 보고서는 Kevin Weil이 이끄는 전용 팀과 GPT-Rosalind의 출시를 포함한 OpenAI의 광범위한 과학 전략과 일치합니다.
출처: The Decoder (DE) —
원문
