Relatório de Campo da OpenAI: agentes de IA reescrevem software de pesquisa frágil, mas pesquisadores precisam verificar rigorosamente
OpenAI
Anthropic
A OpenAI e parceiros acadêmicos descobriram que agentes de codificação de IA podem acelerar e manter software de pesquisa envelhecido, mas o ônus passa da programação para a verificação. Em oito estudos de caso, os agentes modernizaram ferramentas, algumas rodando mais de 60 vezes mais rápido, mas frequentemente se comportavam com confiança enquanto produziam código incorreto. Os pesquisadores enfatizam a necessidade de validação independente e supervisão científica.
Um relatório de campo da OpenAI e parceiros acadêmicos documenta oito estudos de caso, principalmente em biologia, nos quais agentes de codificação como Codex e Claude Code foram usados para manter, otimizar ou reescrever software de pesquisa. Os projetos variaram de manutenção simples a reescritas completas em linguagens modernas. Por exemplo, o GPT-5.5 modernizou o processo de build para a biblioteca Python cyvcf2, enquanto dois agentes, Claude Code e Codex, migraram cerca de 10.000 linhas do MHCflurry de TensorFlow para PyTorch. O projeto rustar-aligner reescreveu o STAR, uma ferramenta C/C++ com milhares de linhas, em Rust, alcançando concordância de 99,815% e 99,883% com o original em conjuntos de dados de teste. O RustQC, que agrupou 15 ferramentas de controle de qualidade, reduziu o tempo de execução de 15 horas e 34 minutos para 14 minutos e 54 segundos—um fator de mais de 60. O HelixForge, um substituto para o BamSurgeon, foi 59,6 vezes mais rápido no geral, com o cálculo principal 98,6 vezes mais rápido. No entanto, os agentes frequentemente pareciam confiantes, mas estavam errados; por exemplo, na reescrita do bayesm, dois procedimentos continham erros sutis, incluindo um parâmetro de controle invertido e um fator de escala defeituoso. Os pesquisadores concluíram que os humanos devem definir objetivos, critérios de sucesso e métodos de validação, enquanto os agentes lidam com a implementação. O relatório estima economias de tempo significativas—por exemplo, manter o NumPy poderia economizar cerca de 650 horas por ano—mas destaca a manutenção e a responsabilidade de longo prazo como desafios-chave. Algumas mudanças foram incorporadas ao código-fonte original, enquanto outras, como o FastQC, foram rejeitadas pelo autor original, levando a melhorias incorporadas à versão Java original. O relatório é retrospectivo e baseado em autorrelatos, e observa que o gargalo está se deslocando da implementação para a validação e a revisão científica. Esse padrão é ecoado por um estudo do METR e um estudo sobre a frustração das equipes de desenvolvedores com o código de IA. O relatório está alinhado com a estratégia científica mais ampla da OpenAI, que inclui uma equipe dedicada liderada por Kevin Weil e o lançamento do GPT-Rosalind.
Fonte: The Decoder (DE) —
original
