6 دروس لإنشاء معايير تقييم من دورة NeurIPS التعليمية

Google DeepMindGoogle DeepMind
ناقش مؤلفو SWE-bench وGPQA في NeurIPS الأخطاء الرئيسية في إنشاء معايير التقييم: طغيان المقاييس، ذاتية الاستعانة بالمصادر الجماعية، خطر استخدام نماذج اللغة الكبيرة كمقيمين، والحاجة إلى اختبارات ديناميكية. النصيحة الرئيسية — تجنب المعايير المشبعة، والتحقق من تعدد الوسائط، ونشر النتائج مع فترات الثقة.
في البرنامج التعليمي لمؤتمر NeurIPS بعنوان "فن القياس" الذي شارك فيه مؤلفو معياري SWE-bench وGPQA وباحثون من Google DeepMind وجامعة نيويورك وجامعة بيركلي، تمت مناقشة القضايا والمزالق الرئيسية في إنشاء المعايير. وتشمل هذه استبداد المقاييس، حيث تحتوي المقاييس على نقاط حلوة تسمح للنماذج "باختراق" الاختبار، مع فشل ارتباط بيرسون في اكتشاف هذه النقاط. ولوحظ أيضًا أن استخدام نماذج اللغة الكبيرة كمصادر تقييم أمر خطير: فهي ترتبط بالبشر فقط على مجموعة المعايرة، والتحيز الذاتي يؤدي إلى تضخيم النتائج الخاصة بها. النهج الصحيح الوحيد هو توليد أمثلة يفشل فيها النموذج. من بين الأخطاء الرئيسية الستة التي يرتكبها مبتكرو المعايير: إطلاق معيار بدقة 70-80% على النموذج الأفضل (يجب استهداف 0-1%)، عدم التحقق من تعددية الوسائط الحقيقية للمهمة، الاعتماد على نظرية الذكاء الخاصة، الفشل في تصفية البريد العشوائي من العمال (حتى 25% إجابات عشوائية)، تركيز العمل على عامل واحد، ونشر النتائج دون قيم الاحتمال وفترات الثقة. في المستقبل، نحتاج إلى معايير ديناميكية، ودراسات طولية حول تأثير نماذج اللغة الكبيرة على البشر، ومعايرة معرفة النموذج، ومهام يمكن لقطة حلها ولكن لا يستطيع GPT حلها.
المصدر: Хабр — Data Mining — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة