ScarfBench: Vertailupohja tekoälyagenttien arviointiin yritysten Java-kehysten migraatiossa
IBM
Anthropic
ScarfBench, avoin vertailupohja tekoälyagenttien arviointiin Spring-, Jakarta EE- ja Quarkus-kehysten välisissä migraatiotehtävissä, on julkaistu. Testit osoittivat, että jopa parhaat agentit tekevät usein virheitä, eikä agenttien omiin raportteihin migraation valmistumisesta voi luottaa. Pääasiallinen haaste ei ole koodin kääntäminen, vaan riippuvuuksien hallinta konfiguraatiossa, infrastruktuurissa ja suoritusympäristössä.
ScarfBench (Self-Contained Application Refactoring Benchmark) on uusi avoimen lähdekoodin vertailutyökalu tekoälyagenttien arvioimiseen yritysten Java-kehyksien (Spring, Jakarta EE ja Quarkus) välisissä migraatiotehtävissä. Toisin kuin perinteiset vertailutyökalut, jotka vertaavat tuotettua koodia referenssiin, ScarfBench tarkistaa, että siirretty sovellus kääntyy, käynnistyy ja säilyttää toiminnallisuutensa. Tutkijat arvioivat useita nykyaikaisia koodausagentteja. Tulokset osoittivat, että migraation onnistuminen vaihtelee suuresti kehysparin mukaan, ja kokonaisten sovellusten siirtäminen on erityisen haastavaa. Agentit osoittautuivat liian itsevarmoiksi: esimerkiksi Claude Code ilmoitti 29 kokonaisen sovelluksen 30:stä kääntyvän onnistuneesti, mutta todellisuudessa vain 22 kääntyi. Agenttien itsearviointia ei voida pitää luotettavana signaalina migraation valmistumisesta. Konfiguraatio osoittautui kerrokseksi, joka vaati eniten työtä – agentit palasivat konfiguraatiotiedostoihin toistuvasti. Myös ympäristöongelmat olivat yleisiä: Docker-välimuistin epäjohdonmukaisuudet, porttien ja työkalujen ongelmat. Keskeinen johtopäätös: vaikein osa modernisointia ei ole Java-koodin kääntäminen vaan konfiguraation, infrastruktuurin ja suoritusympäristön välisten riippuvuuksien hallinta.
Lähde: Hugging Face blog —
Alkuperäinen
