النماذج 🇷🇺 07.08.2026 13:01

GuardRate: بناء ساحة مستقلة لنماذج الحماية (الجزء الأول)

MetaMeta NVIDIANVIDIA OpenAIOpenAI AllenAIAllenAI MicrosoftMicrosoft
يقدم فريق HiveTrace أداة GuardRate ولوحة صدارة لتقييم نماذج الحماية بشكل موضوعي. تعمل الأداة على أتمتة الاختبارات المعيارية، وتوفر مقاييس شفافة مثل FPR (معدل النتائج الإيجابية الكاذبة) وFNR (معدل النتائج السلبية الكاذبة)، وتسلط الضوء على رؤى مثل أهمية البنية على الحجم. أصبحت لوحة الصدارة الآن عامة، ومن المقرر إصدار كود مصدر CLI في الربع الثالث من عام 2026.
قام فريق HiveTrace بإنشاء GuardRate، وهي أداة سطر أوامر وقائمة متصدرين عامة (HiveTrace GuardRate Leaderboard) للمقارنة الموضوعية بين نماذج الحماية الخاصة بنماذج اللغة الكبيرة. تعمل الأداة على أتمتة خط أنابيب التقييم: فهي تسحب مجموعات البيانات وإعدادات النماذج من ملفات YAML، وتشغل بيئات معزولة لكل نموذج، وتنفذ معايير ثابتة، وتحسب المقاييس (معدل الإيجابيات الخاطئة، معدل السلبيات الخاطئة، النتيجة التكاملية). تكون النتائج قابلة للتكرار عبر القطع الأثرية. تقوم قائمة المتصدرين بترتيب النماذج حسب النتيجة التكاملية؛ وتشمل النماذج الرائدة YuFeng-XGuard-Reason-8B (0.761)، وHiveTraceGuard-Pro 0.6B (0.743)، وOpenGuardrails-Text-2510 (0.738). تظهر الرؤى أن البنية المعمارية أكثر أهمية من الحجم، ويمكن للنماذج الصغيرة أن تتفوق على الأكبر، ويتباين زمن الاستجابة بشكل كبير (على سبيل المثال، يبلغ زمن الاستجابة للنسبة المئوية 95 لـ Llama-3.1-Nemotron-Safety-Guard-8B 398.3 ميلي ثانية). أدت العملية إلى تقليل وقت التدقيق من حوالي 5 ساعات إلى 30 دقيقة، مما خفض تكلفة العمل بنسبة 90 في المئة. ومن المقرر إصدار الكود المصدري في الربع الثالث من عام 2026.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة