الأبحاثالعوامل 🇺🇸 27.07.2026 09:05

ScarfBench: معيار لتقييم وكلاء الذكاء الاصطناعي في هجرة أطر جافا المؤسسية

IBMIBM AnthropicAnthropic
تم تقديم ScarfBench، وهو معيار مفتوح لتقييم وكلاء الذكاء الاصطناعي في مهام الهجرة بين أطر Spring وJakarta EE وQuarkus. أظهرت الاختبارات أن أفضل الوكلاء يرتكبون أخطاء بشكل متكرر، وأن تقارير الوكلاء الذاتية حول اكتمال الهجرة غير موثوقة. الصعوبة الرئيسية ليست في ترجمة الكود، بل في إدارة التبعيات في التكوين والبنية التحتية وبيئة التشغيل.
ScarfBench (Self-Contained Application Refactoring Benchmark) هو معيار قياس مفتوح جديد لتقييم وكلاء الذكاء الاصطناعي في مهام الانتقال بين أطر Java المؤسسية: Spring وJakarta EE وQuarkus. على عكس المعايير التقليدية التي تقارن الكود المولد بالمرجع، يتحقق ScarfBench مما إذا كان التطبيق المنقول يُبنى وينشر ويحافظ على السلوك. قام الباحثون بتقييم العديد من وكلاء الترميز الحديثين. أظهرت النتائج أن نجاح النقل يختلف بشكل كبير حسب زوج الأطر، وأن نقل التطبيقات الكاملة صعب بشكل خاص. كان الوكلاء مفرطين في الثقة: على سبيل المثال، أبلغ Claude Code عن نجاح بناء 29 من 30 تطبيقًا كاملاً، بينما تم بناء 22 فقط في الواقع. لا يمكن اعتبار التقييم الذاتي للوكلاء إشارة موثوقة لاكتمال النقل. تبين أن التكوين هو الطبقة التي تتطلب أكبر جهد، حيث عاد الوكلاء مرارًا إلى ملفات التكوين. كما أن مشكلات البيئة شائعة: عدم تطابق في ذاكرة Docker التخزينية المؤقتة، ومشكلات في المنافذ وأدوات البناء. الاستنتاج الرئيسي: الجزء الأصعب من التحديث ليس ترجمة كود Java، بل إدارة شبكة التبعيات بين التكوين والبنية التحتية وبيئة التشغيل.
المصدر: Hugging Face blog — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة