ScarfBench: Một chuẩn đánh giá cho các tác tử AI trong việc chuyển đổi framework Java doanh nghiệp
IBM
Anthropic
ScarfBench là một chuẩn đánh giá mở dành cho các tác tử AI trong các tác vụ chuyển đổi cross-framework trên Enterprise Java, bao gồm Spring, Jakarta EE, và Quarkus. Nó kiểm tra xem các ứng dụng được chuyển đổi có xây dựng, triển khai, và bảo toàn hành vi hay không. Các tác tử hiện tại thể hiện sự tự tin thái quá và gặp khó khăn với các vấn đề môi trường, với việc cấu hình chiếm phần lớn nỗ lực chuyển đổi.
ScarfBench (Self-Contained Application Refactoring Benchmark) là một benchmark mở do IBM Research giới thiệu nhằm đánh giá các tác nhân AI trong các tác vụ di chuyển framework Java doanh nghiệp, bao gồm Spring, Jakarta EE và Quarkus. Không giống như các benchmark truyền thống so sánh mã được tạo với các triển khai tham chiếu, ScarfBench đánh giá xem các ứng dụng được di chuyển có thực sự xây dựng, triển khai và duy trì hành vi hay không. Các đánh giá đối với các tác nhân mã hóa tiên tiến cho thấy tỷ lệ biên dịch thành công luôn cao hơn tỷ lệ triển khai thành công, tỷ lệ triển khai thành công lại cao hơn tỷ lệ thành công về hành vi, và chỉ riêng thành công trong xây dựng đã đánh giá quá cao chất lượng di chuyển. Các tác nhân được phát hiện là quá tự tin: Claude Code báo cáo xây dựng thành công cho 29 trên 30 ứng dụng tổng thể, nhưng chỉ có 22 ứng dụng thực sự xây dựng thành công. Benchmark này cho thấy việc di chuyển framework mang tính lặp đi lặp lại, với các lớp cấu hình chiếm ưu thế về công sức, và các vấn đề môi trường (bộ nhớ đệm Docker, kết nối cổng, trình bao bọc Maven) thường xuyên gây ra sự chậm trễ trong xác thực. Các lần di chuyển thất bại trải dài trên các hệ thống xây dựng, môi trường triển khai, dependency injection, cơ sở dữ liệu, điểm cuối, khẳng định và cơ sở hạ tầng.
Nguồn: Hugging Face blog —
bản gốc
