Rapport de terrain d'OpenAI : les agents IA réécrivent des logiciels de recherche fragiles, mais les chercheurs doivent vérifier rigoureusement
OpenAI
Anthropic
OpenAI et ses partenaires académiques ont constaté que les agents de codage par IA peuvent accélérer et maintenir des logiciels de recherche vieillissants, mais la charge de travail se déplace de la programmation vers la vérification. Dans huit études de cas, les agents ont modernisé des outils, certains fonctionnant plus de 60 fois plus vite, mais ils ont souvent affiché une grande confiance tout en produisant un code incorrect. Les chercheurs soulignent la nécessité d'une validation indépendante et d'une supervision scientifique.
Un rapport de terrain d'OpenAI et de partenaires académiques documente huit études de cas, principalement en biologie, où des agents de codage tels que Codex et Claude Code ont été utilisés pour maintenir, optimiser ou réécrire des logiciels de recherche. Les projets allaient de simples maintenances à des réécritures complètes dans des langages modernes. Par exemple, GPT-5.5 a modernisé le processus de construction de la bibliothèque Python cyvcf2, tandis que deux agents, Claude Code et Codex, ont migré environ 10 000 lignes de MHCflurry de TensorFlow vers PyTorch. Le projet rustar-aligner a réécrit STAR, un outil C/C++ de plusieurs milliers de lignes, en Rust, atteignant un accord de 99,815 % et 99,883 % avec l'original sur les jeux de données de test. RustQC, qui regroupait 15 outils de contrôle qualité, a réduit le temps d'exécution de 15 heures 34 minutes à 14 minutes 54 secondes, soit un facteur de plus de 60. HelixForge, un remplaçant de BamSurgeon, était 59,6 fois plus rapide dans l'ensemble, avec le calcul de base 98,6 fois plus rapide. Cependant, les agents semblaient souvent confiants mais se trompaient ; par exemple, dans la réécriture de bayesm, deux procédures contenaient des erreurs subtiles, notamment un paramètre de contrôle inversé et un facteur d'échelle défectueux. Les chercheurs ont conclu que les humains doivent définir les objectifs, les critères de réussite et les méthodes de validation, tandis que les agents s'occupent de l'implémentation. Le rapport estime des gains de temps significatifs — par exemple, maintenir NumPy pourrait économiser environ 650 heures par an — mais souligne la maintenance à long terme et la responsabilité comme défis clés. Certaines modifications ont été fusionnées en amont, tandis que d'autres, comme FastQC, ont été rejetées par l'auteur original, ce qui a conduit à intégrer les améliorations dans la version Java originale. Le rapport est rétrospectif et basé sur des auto-évaluations, et il note que le goulot d'étranglement se déplace de l'implémentation vers la validation et la revue scientifique. Cette tendance est reprise par une étude METR et une étude sur la frustration des équipes de développement face à l'IA générative de code. Le rapport s'aligne avec la stratégie scientifique plus large d'OpenAI, qui comprend une équipe dédiée dirigée par Kevin Weil et la sortie de GPT-Rosalind.
Source: The Decoder (DE) —
original
