AgentenOnderzoek 🇩🇪 01.08.2026 17:02

OpenAI-veldrapport: AI-agenten herschrijven kwetsbare onderzoekssoftware, maar onderzoekers moeten grondig verifiëren

OpenAIOpenAI AnthropicAnthropic
OpenAI en academische partners ontdekten dat AI-codeeragenten verouderde onderzoekssoftware kunnen versnellen en onderhouden, maar de last verschuift van programmeren naar verificatie. In acht casestudy's moderniseerden agenten tools, sommige draaiden meer dan 60 keer sneller, maar ze vertoonden vaak zelfverzekerd gedrag terwijl ze onjuiste code produceerden. Onderzoekers benadrukken de noodzaak van onafhankelijke validatie en wetenschappelijk toezicht.
Een veldrapport van OpenAI en academische partners documenteert acht casestudy's, voornamelijk in de biologie, waarin codeeragenten zoals Codex en Claude Code werden gebruikt om onderzoekssoftware te onderhouden, optimaliseren of herschrijven. Projecten varieerden van eenvoudig onderhoud tot volledige herschrijvingen in moderne talen. Zo moderniseerde GPT-5.5 bijvoorbeeld het bouwproces voor de Python-bibliotheek cyvcf2, terwijl twee agenten, Claude Code en Codex, ongeveer 10.000 regels MHCflurry migreerden van TensorFlow naar PyTorch. Het rustar-aligner-project herschreef STAR, een tool van duizenden regels C/C++, in Rust, met een overeenkomst van 99,815% en 99,883% met het origineel op testdatasets. RustQC, dat 15 kwaliteitscontroletools bundelde, reduceerde de runtime van 15 uur 34 minuten tot 14 minuten 54 seconden—een factor van meer dan 60. HelixForge, een vervanging voor BamSurgeon, was 59,6 keer sneller in totaal, met de kernberekening 98,6 keer sneller. Agenten leken echter vaak zelfverzekerd maar zaten er mis; in de bayesm-herschrijving bevatten twee procedures bijvoorbeeld subtiele fouten, waaronder een omgekeerde control parameter en een foutieve schaalfactor. Onderzoekers concludeerden dat mensen doelen, succescriteria en validatiemethoden moeten definiëren, terwijl agenten de implementatie afhandelen. Het rapport schat aanzienlijke tijdswinsten—zo zou het onderhouden van NumPy ongeveer 650 uur per jaar kunnen besparen—maar benadrukt onderhoud op lange termijn en verantwoordelijkheid als belangrijke uitdagingen. Sommige wijzigingen werden upstream samengevoegd, terwijl andere, zoals FastQC, werden afgewezen door de oorspronkelijke auteur, waardoor verbeteringen in plaats daarvan werden geïntegreerd in de originele Java-versie. Het rapport is retrospectief en gebaseerd op zelfrapportages, en het merkt op dat de bottleneck verschuift van implementatie naar validatie en wetenschappelijke beoordeling. Dit patroon wordt herhaald door een METR-studie en een onderzoek naar de frustratie van ontwikkelteams met AI-code. Het rapport sluit aan bij OpenAI's bredere wetenschapsstrategie, die een toegewijd team onder leiding van Kevin Weil en de release van GPT-Rosalind omvat.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws