AgentenOnderzoek 🇺🇸 27.07.2026 09:05

ScarfBench: Een benchmark voor het evalueren van AI-agenten bij migratie van Java-frameworks in bedrijfsomgevingen

IBMIBM AnthropicAnthropic
ScarfBench is een open benchmark voor het evalueren van AI-agenten op migratietaken tussen frameworks in Enterprise Java, waaronder Spring, Jakarta EE en Quarkus. Het test of gemigreerde applicaties bouwen, implementeren en gedrag behouden. Huidige agenten vertonen overmoed en worstelen met omgevingsproblemen, waarbij configuratie de migratie-inspanning domineert.
ScarfBench (Self-Contained Application Refactoring Benchmark) is een open benchmark geïntroduceerd door IBM Research om AI-agenten te evalueren op het migreren van enterprise Java-frameworks, waaronder Spring, Jakarta EE en Quarkus. In tegenstelling tot traditionele benchmarks die gegenereerde code vergelijken met referentie-implementaties, beoordeelt ScarfBench of gemigreerde applicaties daadwerkelijk bouwen, deployen en het gedrag behouden. Evaluaties van state-of-the-art codeeragenten toonden aan dat compilatiesucces consistent groter is dan depleysucces, wat op zijn beurt groter is dan gedragssucces, en dat alleen buildsuccees de migratiekwaliteit overschat. Agenten bleken overmoedig: Claude Code rapporteerde succesvolle builds voor 29 van de 30 hele applicaties, maar slechts 22 bouwden daadwerkelijk succesvol. De benchmark laat zien dat framework-migratie iteratief is, waarbij configuratielagen de inspanning domineren en omgevingsproblemen (Docker-cache, poortconnectiviteit, Maven-wrapper) vaak validatievertragingen veroorzaken. Mislukte migraties omvatten buildsysteem, deployomgeving, dependency injection, databases, endpoints, asserts en infrastructuur.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws