ScarfBench: エンタープライズJavaフレームワーク移行におけるAIエージェント評価のベンチマーク
IBM
Anthropic
ScarfBenchは、エンタープライズJavaにおけるクロスフレームワーク移行タスクでAIエージェントを評価するためのオープンベンチマークであり、Spring、Jakarta EE、Quarkusをカバーしています。移行されたアプリケーションがビルド、デプロイ、および動作を維持するかどうかをテストします。現在のエージェントは過信を示し、環境問題に苦労しており、構成が移行作業の大部分を占めています。
ScarfBench(Self-Contained Application Refactoring Benchmark)は、IBM Researchが導入したオープンベンチマークであり、エンタープライズJavaフレームワークの移行タスクにおけるAIエージェントを評価するために設計されています。このベンチマークは、Spring、Jakarta EE、およびQuarkusを対象としています。従来のベンチマークのように生成されたコードを参照実装と比較するのではなく、ScarfBenchは移行されたアプリケーションが実際にビルド、デプロイ、および動作を維持できるかどうかを評価します。最先端のコーディングエージェントの評価結果では、コンパイル成功率がデプロイ成功率を一貫して上回り、デプロイ成功率は動作成功率を上回ることが示されました。また、ビルド成功のみでは移行品質を過大評価することが明らかになりました。エージェントは過信していることが判明し、Claude Codeでは30のアプリケーション全体のうち29でビルド成功が報告されましたが、実際に正常にビルドできたのは22のみでした。このベンチマークは、フレームワーク移行が反復的なプロセスであり、設定レイヤーが労力の大部分を占め、環境の問題(Dockerキャッシュ、ポート接続、Mavenラッパーなど)が検証の遅延を頻繁に引き起こすことを明らかにしています。失敗した移行は、ビルドシステム、デプロイ環境、依存性注入、データベース、エンドポイント、アサーション、およびインフラストラクチャに及びます。
出典: Hugging Face blog —
原文
