مفتوح المصدرالعوامل 🇺🇸 01.08.2026 13:02

Supabase تفتح مصدر تقييماتها: قياس أداء وكلاء البرمجة بالذكاء الاصطناعي في المهام الحقيقية

AnthropicAnthropic OpenAIOpenAI Moonshot AIMoonshot AI
أعلنت Supabase عن فتح مصدر إطار عمل التقييمات الخاص بها، وهو معيار وإطار لاختبار مدى جودة بناء وكلاء البرمجة بالذكاء الاصطناعي باستخدام Supabase. يعمل هذا الإطار على تشغيل وكلاء مثل Claude Code وCodex وOpenCode في مهام حقيقية، ويقيم النتائج باستخدام مزيج من الفحوصات الحتمية وتقييم نموذج لغوي كبير كحَكَم. يتوفر الإطار بموجب رخصة Apache-2.0، ويشغل لوحة صدارة عامة.
أعلنت Supabase عن إتاحة مصدرها المفتوح لـ Supabase Evals، وهو معيار وإطار عمل لاختبار مدى جودة بناء وكلاء الذكاء الاصطناعي باستخدام Supabase. يشغّل الإطار وكلاء البرمجة بما في ذلك Claude Code وCodex وOpenCode مقابل مهام حقيقية مثل بناء مخطط قاعدة بيانات، أو تصحيح أخطاء دالة Edge فاشلة، أو إصلاح سياسة RLS معطّلة، ثم يقوم بتقييم النتيجة. يعمل هذا المعيار على تشغيل لوحة صدارة عامة على supabase.com/evals بالإضافة إلى مجموعة اختبارات انحدار داخلية تُراقَب يوميًا. يتوفر الإطار بموجب ترخيص Apache-2.0 ويعمل محليًا عبر pnpm. تغطي السيناريوهات أبعادًا مثل المنتجات (قاعدة البيانات، المصادقة، التخزين) والمواضيع (RLS، الأمان)، ويتم تشغيل كل سيناريو مقابل حزمة Supabase حقيقية داخل حاويات. يجمع التقييم بين الفحوصات الحتمية واستخدام نموذج لغوي كبير كمحكّم، ويحصل الوكلاء على محاولة واحدة إضافية. تُظهر النتائج الرئيسية أن النماذج الأفضل مثل Opus 5 وKimi K3 حققت نتيجة 100% دون مساعدة، بينما ساعدت المهارات النماذج الأصغر على تضييق الفجوة. تشمل نقاط الضعف الاعتماد على ترحيلات مكتوبة يدويًا بدلاً من مخططات تعريفية، والتحقق اليدوي من المصادقة، وعدم اتساق استخدام الوثائق بين الوكلاء.
المصدر: MarkTechPost — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة