AgentitTutkimus 🇩🇪 01.08.2026 17:02

OpenAI:n kenttäraportti: tekoälyagentit kirjoittavat uudelleen hauraan tutkimusohjelmiston, mutta tutkijoiden on varmistettava tulokset tiukasti

OpenAIOpenAI AnthropicAnthropic
OpenAI ja akateemiset kumppanit havaitsivat, että tekoälypohjaiset koodausagentit voivat nopeuttaa ja ylläpitää ikääntyvää tutkimusohjelmistoa, mutta vastuu siirtyy ohjelmoinnista varmistamiseen. Kahdeksassa tapaustutkimuksessa agentit modernisoivat työkaluja, jotkut yli 60 kertaa nopeammin, mutta ne usein käyttäytyivät itsevarmasti tuottaen virheellistä koodia. Tutkijat korostavat riippumattoman validoinnin ja tieteellisen valvonnan tarvetta.
OpenAI:n ja akateemisten kumppaneiden kenttäraportti dokumentoi kahdeksan tapaustutkimusta, pääasiassa biologiasta, joissa koodausagentteja, kuten Codex ja Claude Code, käytettiin tutkimusohjelmistojen ylläpitämiseen, optimointiin tai uudelleenkirjoittamiseen. Projektit vaihtelivat yksinkertaisesta ylläpidosta täydellisiin uudelleenkirjoituksiin moderneilla kielillä. Esimerkiksi GPT-5.5 modernisoi Python-kirjasto cyvcf2:n rakennusprosessin, kun taas kaksi agenttia, Claude Code ja Codex, siirsivät noin 10 000 riviä MHCflurrya TensorFlow:sta PyTorchiin. rustar-aligner-projekti kirjoitti STARin, useita tuhansia rivejä käsittävän C/C++-työkalun, uudelleen Rustilla, saavuttaen 99,815 % ja 99,883 % yhdenmukaisuuden alkuperäisen kanssa testiaineistoissa. RustQC, joka yhdisti 15 laadunvalvontatyökalua, lyhensi suoritusajan 15 tunnista 34 minuutista 14 minuuttiin 54 sekuntiin—yli 60-kertaiseksi. HelixForge, BamSurgeonin korvaaja, oli 59,6 kertaa nopeampi kokonaisuudessaan, ja ydinlaskenta oli 98,6 kertaa nopeampi. Agentit vaikuttivat kuitenkin usein itsevarmoilta mutta olivat väärässä; esimerkiksi bayesm-uudelleenkirjoituksessa kaksi proseduuria sisälsi hienovaraisia virheitä, mukaan lukien käänteisen ohjausparametrin ja virheellisen skaalaustekijän. Tutkijat päättelivät, että ihmisten on määriteltävä tavoitteet, onnistumiskriteerit ja validointimenetelmät, kun taas agentit hoitavat toteutuksen. Raportti arvioi merkittäviä ajansäästöjä—esimerkiksi NumPyn ylläpito voisi säästää noin 650 tuntia vuodessa—mutta korostaa pitkäaikaisen ylläpidon ja vastuun keskeisinä haasteina. Jotkut muutokset yhdistettiin ylävirtaan, kun taas toiset, kuten FastQC, hylättiin alkuperäisen kirjoittajan toimesta, mikä johti parannusten sisällyttämiseen alkuperäiseen Java-versioon. Raportti on retrospektiivinen ja perustuu itsearviointeihin, ja siinä todetaan, että pullonkaula siirtyy toteutuksesta validointiin ja tieteelliseen arviointiin. Tämä kuvio toistuu METR-tutkimuksessa ja tutkimuksessa kehittäjätiimien turhautumisesta tekoälykoodiin. Raportti on linjassa OpenAI:n laajemman tiedestrategian kanssa, joka sisältää Kevin Weilin johtaman omistetun tiimin ja GPT-Rosalindin julkaisun.
Lähde: The Decoder (DE) — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset