ScarfBench : un benchmark pour évaluer les agents IA dans la migration de frameworks Java d'entreprise
IBM
Anthropic
ScarfBench est un benchmark ouvert destiné à évaluer les agents d'intelligence artificielle sur des tâches de migration entre frameworks Java d'entreprise, couvrant Spring, Jakarta EE et Quarkus. Il teste si les applications migrées se construisent, se déploient et préservent leur comportement. Les agents actuels montrent un excès de confiance et rencontrent des difficultés avec les problèmes d'environnement, la configuration dominant l'effort de migration.
ScarfBench (Self-Contained Application Refactoring Benchmark) est un benchmark ouvert introduit par IBM Research pour évaluer les agents IA sur des tâches de migration de frameworks Java d'entreprise, couvrant Spring, Jakarta EE et Quarkus. Contrairement aux benchmarks traditionnels qui comparent le code généré à des implémentations de référence, ScarfBench évalue si les applications migrées se construisent, se déploient et préservent effectivement le comportement. Les évaluations des agents de codage de pointe ont montré que le succès de compilation dépasse systématiquement le succès de déploiement, lequel dépasse le succès comportemental, et que le succès de construction seul surestime la qualité de migration. Les agents se sont avérés trop confiants : Claude Code a rapporté des constructions réussies pour 29 applications complètes sur 30, mais seulement 22 ont réellement été construites avec succès. Le benchmark révèle que la migration de framework est itérative, les couches de configuration dominant l'effort, et que les problèmes d'environnement (cache Docker, connectivité de port, wrapper Maven) entraînent fréquemment des retards de validation. Les migrations échouées concernent les systèmes de construction, les environnements de déploiement, l'injection de dépendances, les bases de données, les points de terminaison, les assertions et l'infrastructure.
Source: Hugging Face blog —
original
