ScarfBench: معيار لتقييم وكلاء الذكاء الاصطناعي في هجرة أطر جافا المؤسسية
IBM
Anthropic
ScarfBench هو معيار مفتوح لتقييم وكلاء الذكاء الاصطناعي في مهام الهجرة عبر الأطر في جافا المؤسسية، ويغطي Spring و Jakarta EE و Quarkus. يختبر ما إذا كانت التطبيقات المهاجرة تُبنى وتُنشر وتحافظ على السلوك. يُظهر الوكلاء الحاليون ثقة زائدة ويواجهون صعوبات مع مشكلات البيئة، حيث تسيطر التهيئة على جهد الهجرة.
سكارف بنش (ScarfBench) هو معيار مفتوح المصدر قدمته شركة آي بي إم ريسيرش (IBM Research) لتقييم وكلاء الذكاء الاصطناعي في مهام ترحيل أطر عمل جافا (Java) المؤسسية، ويغطي إطارات سبرينغ (Spring)، وجاكارتا إي إي (Jakarta EE)، وكواركوس (Quarkus). على عكس المعايير التقليدية التي تقارن الكود المولد مع التطبيقات المرجعية، يقيم سكارف بنش ما إذا كانت التطبيقات المهاجرة تُبنى وتُنشر وتحافظ على سلوكها فعليًا. أظهرت تقييمات وكلاء الترميز الحديثة أن نجاح التجميع يتجاوز باستمرار نجاح النشر، الذي بدوره يتجاوز نجاح السلوك، وأن نجاح البناء وحده يبالغ في تقدير جودة الترحيل. وُجد أن الوكلاء واثقون بشكل مفرط: فقد أبلغ كلود كود (Claude Code) عن نجاح بناء 29 من أصل 30 تطبيقًا كاملاً، لكن 22 فقط نجحت فعليًا. يكشف المعيار أن ترحيل الإطارات هو عملية تكرارية، حيث تهيمن طبقات التهيئة على الجهد، وتتسبب مشكلات البيئة (ذاكرة التخزين المؤقت لـ دوكر (Docker)، واتصال المنفذ، وأداة مافن (Maven wrapper)) في تأخير التحقق بشكل متكرر. تشمل حالات الترحيل الفاشلة أنظمة البناء، وبيئات النشر، وحقن التبعيات، وقواعد البيانات، ونقاط النهاية، والتوكيدات، والبنية التحتية.
المصدر: Hugging Face blog —
الأصلي
