ScarfBench: एंटरप्राइज जावा फ्रेमवर्क माइग्रेशन में AI एजेंटों के मूल्यांकन के लिए एक बेंचमार्क
IBM
Anthropic
ScarfBench एंटरप्राइज जावा में क्रॉस-फ्रेमवर्क माइग्रेशन कार्यों पर AI एजेंटों के मूल्यांकन के लिए एक ओपन बेंचमार्क है, जो Spring, Jakarta EE और Quarkus को कवर करता है। यह परीक्षण करता है कि माइग्रेटेड एप्लिकेशन बिल्ड, डिप्लॉय और व्यवहार संरक्षित करते हैं या नहीं। वर्तमान एजेंट अति-आत्मविश्वास दिखाते हैं और एनवायरनमेंट संबंधी समस्याओं से जूझते हैं, जिसमें कॉन्फ़िगरेशन माइग्रेशन प्रयास पर हावी है।
IBM Research द्वारा प्रस्तुत ScarfBench (Self-Contained Application Refactoring Benchmark) एक ओपन बेंचमार्क है, जो एंटरप्राइज जावा फ्रेमवर्क माइग्रेशन कार्यों—जैसे स्प्रिंग, जकार्ता ईई, और क्वार्कस—में एआई एजेंटों का मूल्यांकन करने के लिए बनाया गया है। पारंपरिक बेंचमार्क से अलग, जो जनरेटेड कोड की तुलना संदर्भ कार्यान्वयन से करते हैं, ScarfBench यह आकलन करता है कि क्या माइग्रेटेड एप्लीकेशन वास्तव में बिल्ड, डिप्लॉय और व्यवहार संरक्षण करती हैं। आधुनिक कोडिंग एजेंटों के मूल्यांकन से पता चला कि कंपाइल सक्सेस डिप्लॉय सक्सेस को पार करती है, जो व्यवहारिक सक्सेस से आगे है, और बिल्ड सक्सेस अकेले माइग्रेशन गुणवत्ता का अतिमूल्यांकन करती है। एजेंट अति-आत्मविश्वासी पाए गए: Claude Code ने 30 में से 29 पूर्ण एप्लीकेशनों के लिए सफल बिल्ड बताया, लेकिन केवल 22 वास्तव में सफलतापूर्वक बिल्ड हुईं। यह बेंचमार्क दर्शाता है कि फ्रेमवर्क माइग्रेशन पुनरावृत्तीय है, जहाँ कॉन्फ़िगरेशन स्तर प्रयास पर हावी होते हैं, और पर्यावरणीय मुद्दे (डॉकर कैश, पोर्ट कनेक्टिविटी, मैवेन रैपर) अक्सर सत्यापन में देरी का कारण बनते हैं। असफल माइग्रेशन में बिल्ड सिस्टम, डिप्लॉयमेंट वातावरण, डिपेंडेंसी इंजेक्शन, डेटाबेस, एंडपॉइंट, एसर्शन और इंफ्रास्ट्रक्चर शामिल हैं।
स्रोत: Hugging Face blog —
मूल
