ScarfBench: 엔터프라이즈 자바 프레임워크 마이그레이션에서 AI 에이전트를 평가하기 위한 벤치마크
IBM
Anthropic
ScarfBench는 엔터프라이즈 자바의 크로스 프레임워크 마이그레이션 작업에서 AI 에이전트를 평가하기 위한 오픈 벤치마크로, Spring, Jakarta EE, Quarkus를 다룹니다. 마이그레이션된 애플리케이션이 빌드, 배포 및 동작을 유지하는지 테스트합니다. 현재 에이전트는 과신하는 경향이 있고 환경 문제에 어려움을 겪으며, 구성이 마이그레이션 노력의 대부분을 차지합니다.
ScarfBench(자체 포함 애플리케이션 리팩토링 벤치마크)은 IBM Research가 엔터프라이즈 자바 프레임워크 마이그레이션 작업을 수행하는 AI 에이전트를 평가하기 위해 도입한 오픈 벤치마크로, Spring, Jakarta EE, Quarkus를 대상으로 합니다. 생성된 코드를 참조 구현과 비교하는 기존 벤치마크와 달리, ScarfBench는 마이그레이션된 애플리케이션이 실제로 빌드, 배포 및 동작을 유지하는지 평가합니다. 최첨단 코딩 에이전트를 평가한 결과, 컴파일 성공률이 배포 성공률을 일관되게 상회하고, 배포 성공률이 동작 성공률을 상회하며, 빌드 성공만으로는 마이그레이션 품질을 과대평가하는 것으로 나타났습니다. 에이전트는 과신하는 경향이 있어, Claude Code는 전체 애플리케이션 30개 중 29개에서 빌드 성공을 보고했지만 실제로 성공적으로 빌드된 것은 22개에 불과했습니다. 벤치마크는 프레임워크 마이그레이션이 반복적이며, 구성 계층이 대부분의 노력을 차지하고, 환경 문제(Docker 캐시, 포트 연결, Maven 래퍼)가 검증 지연을 자주 초래함을 보여줍니다. 실패한 마이그레이션은 빌드 시스템, 배포 환경, 의존성 주입, 데이터베이스, 엔드포인트, 어서션(assertion), 인프라에 걸쳐 있습니다.
출처: Hugging Face blog —
원문
