ScarfBench: Um Benchmark para Avaliar Agentes de IA na Migração de Frameworks Java Corporativos
IBM
Anthropic
ScarfBench, um benchmark aberto para avaliar agentes de IA em tarefas de migração entre os frameworks Spring, Jakarta EE e Quarkus, foi apresentado. Os testes mostraram que mesmo os melhores agentes cometem erros com frequência, e os autorrelatos dos agentes sobre a conclusão da migração não são confiáveis. A principal dificuldade não é a tradução de código, mas o gerenciamento de dependências na configuração, infraestrutura e ambiente de execução.
ScarfBench (Self-Contained Application Refactoring Benchmark) é um novo benchmark de código aberto para avaliar agentes de IA em tarefas de migração entre frameworks corporativos Java: Spring, Jakarta EE e Quarkus. Diferente de benchmarks tradicionais que comparam o código gerado com uma referência, o ScarfBench verifica se a aplicação migrada compila, é implantada e mantém o comportamento. Os pesquisadores avaliaram diversos agentes de codificação modernos. Os resultados mostraram que o sucesso da migração varia muito dependendo do par de frameworks, e a migração de aplicações completas é particularmente desafiadora. Os agentes se mostraram excessivamente confiantes: por exemplo, o Claude Code relatou compilação bem-sucedida em 29 de 30 aplicações completas, mas apenas 22 realmente compilaram. A autoavaliação dos agentes não pode ser considerada um sinal confiável de conclusão da migração. A configuração revelou-se a camada que exige maior esforço — os agentes retornavam repetidamente aos arquivos de configuração. Problemas de ambiente também foram comuns: inconsistências no cache do Docker, problemas com portas e ferramentas de compilação. A principal conclusão: a parte mais difícil da modernização não é traduzir o código Java, mas gerenciar a rede de dependências entre configuração, infraestrutura e ambiente de execução.
Fonte: Hugging Face blog —
original
