ScarfBench: Un Punto de Referencia para Evaluar Agentes de IA en la Migración de Frameworks Java Empresariales
IBM
Anthropic
ScarfBench es un punto de referencia abierto para evaluar agentes de IA en tareas de migración entre frameworks en Java empresarial, cubriendo Spring, Jakarta EE y Quarkus. Prueba si las aplicaciones migradas compilan, se despliegan y conservan el comportamiento. Los agentes actuales muestran exceso de confianza y tienen dificultades con problemas de entorno, siendo la configuración la que domina el esfuerzo de migración.
ScarfBench (Self-Contained Application Refactoring Benchmark) es un benchmark abierto presentado por IBM Research para evaluar agentes de IA en tareas de migración de frameworks Java empresariales, cubriendo Spring, Jakarta EE y Quarkus. A diferencia de los benchmarks tradicionales que comparan código generado con implementaciones de referencia, ScarfBench evalúa si las aplicaciones migradas realmente se compilan, despliegan y preservan el comportamiento. Las evaluaciones de agentes de codificación de última generación mostraron que el éxito de compilación supera consistentemente al éxito de despliegue, que a su vez supera al éxito de comportamiento, y que el éxito de compilación por sí solo sobreestima la calidad de la migración. Se encontró que los agentes eran demasiado confiados: Claude Code reportó compilaciones exitosas para 29 de 30 aplicaciones completas, pero solo 22 realmente se compilaron correctamente. El benchmark revela que la migración de frameworks es iterativa, con las capas de configuración dominando el esfuerzo, y los problemas de entorno (caché de Docker, conectividad de puertos, envoltorio de Maven) frecuentemente causan retrasos en la validación. Las migraciones fallidas abarcan sistemas de compilación, entornos de despliegue, inyección de dependencias, bases de datos, puntos finales, aserciones e infraestructura.
Fuente: Hugging Face blog —
original
