智能体研究 🇺🇸 27.07.2026 09:05

ScarfBench:评估AI代理在企业级Java框架迁移任务中的基准

IBMIBM AnthropicAnthropic
ScarfBench是一个开放的基准测试,用于评估AI代理在企业级Java中跨框架迁移任务的表现,涵盖Spring、Jakarta EE和Quarkus。它测试迁移后的应用程序是否能构建、部署并保持行为不变。当前的代理表现出过度自信,且在环境问题上遇到困难,配置占据了迁移工作的大部分。
ScarfBench(自包含应用重构基准测试)是IBM Research引入的一个开放基准测试,用于评估AI代理在企业Java框架迁移任务中的表现,涵盖Spring、Jakarta EE和Quarkus。与传统基准测试将生成的代码与参考实现进行比较不同,ScarfBench评估迁移后的应用是否实际构建、部署并保持行为一致。对最先进的编码代理的评估表明,编译成功率始终高于部署成功率,而部署成功率又高于行为成功率,仅凭构建成功会高估迁移质量。代理被发现过于自信:Claude Code报告了30个完整应用中有29个构建成功,但实际上只有22个成功构建。该基准测试揭示,框架迁移是迭代过程,配置层占主导地位,环境问题(Docker缓存、端口连通性、Maven包装器)经常导致验证延迟。失败的迁移涉及构建系统、部署环境、依赖注入、数据库、端点、断言和基础设施。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻