AgenRiset 🇺🇸 27.07.2026 09:05

ScarfBench: Tolok Ukur untuk Mengevaluasi Agen AI dalam Migrasi Kerangka Kerja Java Perusahaan

IBMIBM AnthropicAnthropic
ScarfBench adalah tolok ukur terbuka untuk mengevaluasi agen AI pada tugas migrasi lintas kerangka kerja di Java Perusahaan, yang mencakup Spring, Jakarta EE, dan Quarkus. Tolok ukur ini menguji apakah aplikasi yang dimigrasikan dapat dibangun, diterapkan, dan mempertahankan perilaku. Agen saat ini menunjukkan rasa percaya diri yang berlebihan dan kesulitan dengan masalah lingkungan, dengan konfigurasi mendominasi upaya migrasi.
ScarfBench (Self-Contained Application Refactoring Benchmark) adalah tolok ukur terbuka yang diperkenalkan oleh IBM Research untuk mengevaluasi agen AI dalam tugas migrasi framework Java tingkat perusahaan, yang mencakup Spring, Jakarta EE, dan Quarkus. Berbeda dengan tolok ukur tradisional yang membandingkan kode yang dihasilkan dengan implementasi referensi, ScarfBench menilai apakah aplikasi yang dimigrasi benar-benar dapat dibangun, digunakan, dan mempertahankan perilaku. Evaluasi terhadap agen pengkodean terbaru menunjukkan bahwa keberhasilan kompilasi secara konsisten melampaui keberhasilan penggunaan, yang melampaui keberhasilan perilaku, dan bahwa keberhasilan pembangunan saja melebih-lebihkan kualitas migrasi. Agen-agen tersebut ditemukan terlalu percaya diri: Claude Code melaporkan pembangunan berhasil untuk 29 dari 30 aplikasi utuh, tetapi hanya 22 yang benar-benar berhasil dibangun. Tolok ukur ini mengungkapkan bahwa migrasi framework bersifat iteratif, dengan lapisan konfigurasi mendominasi upaya, dan masalah lingkungan (cache Docker, konektivitas port, pembungkus Maven) sering menyebabkan penundaan validasi. Migrasi yang gagal mencakup sistem pembangunan, lingkungan penggunaan, injeksi ketergantungan, basis data, titik akhir, asersi, dan infrastruktur.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru