ScarfBench: Vertailukohta tekoälyagenttien arvioimiseksi yritys-Java-kehyksen siirtymässä
IBM
Anthropic
ScarfBench on avoin vertailukohta tekoälyagenttien arvioimiseksi ristikehyssiirtymän tehtävissä yritys-Javassa, kattaen Spring, Jakarta EE ja Quarkus -kehykset. Se testaa, rakentuvatko, käyttöönotetaanko ja säilyttävätkö siirretyt sovellukset toiminnallisuuden. Nykyiset agentit osoittavat liiallista itsevarmuutta ja kamppailevat ympäristöongelmien kanssa, ja konfiguraatio dominoi siirtymätyötä.
ScarfBench (Self-Contained Application Refactoring Benchmark) on IBM Researchin esittelemä avoin vertailualusta, joka on suunniteltu arvioimaan tekoälyagenttien suorituskykyä yritys-Java-kehyksen migraatiotehtävissä, kattaen Spring-, Jakarta EE- ja Quarkus-kehykset. Toisin kuin perinteiset vertailualustat, jotka vertaavat tuotettua koodia referenssitoteutuksiin, ScarfBench arvioi, rakentuvatko, käyttöönotetaanko ja säilyttävätkö migroidut sovellukset toimintansa. Huippuluokan koodausagenttien arvioinnit osoittivat, että kääntymisen onnistuminen on johdonmukaisesti korkeampi kuin käyttöönoton onnistuminen, joka on korkeampi kuin toiminnallinen onnistuminen, ja että rakentamisen onnistuminen yksinään yliarvioi migraation laadun. Agenttien havaittiin olevan liian itsevarmoja: Claude Code raportoi onnistuneita rakennuksia 29:lle 30:stä kokonaisesta sovelluksesta, mutta vain 22 rakentui todellisuudessa onnistuneesti. Vertailualusta paljastaa, että kehyssiirto on iteratiivista, jossa konfiguraatiokerrokset hallitsevat työmäärää, ja ympäristöongelmat (Docker-välimuisti, porttiyhteydet, Maven wrapper) aiheuttavat usein validointiviiveitä. Epäonnistuneet migraatiot kattavat rakennusjärjestelmät, käyttöönottoympäristöt, riippuvuuksien injektion, tietokannat, päätepisteet, väitteet ja infrastruktuurin.
Lähde: Hugging Face blog —
Alkuperäinen
