أربع طرق رئيسية لتقييم نماذج LLM: من المعايير إلى نماذج الحكم
تقدم هذه المقالة نظرة عامة على أربع طرق رئيسية لتقييم نماذج اللغات الكبيرة (LLMs): التقييم متعدد الخيارات (MMLU)، المدققات، لوحات الصدارة، ونموذج LLM كحكم. يتم وصف كل طريقة بالتفصيل وتوضيحها مع أمثلة برمجية تعتمد على نموذج Qwen3 0.6B. المادة مبنية على مقال بقلم سيباستيان راشكا.
مقال سيباستيان راشكا يصف أربعة أساليب رئيسية لتقييم نماذج اللغة الكبيرة (Large Language Models): التقييم متعدد الخيارات (مثل معيار MMLU)، المدققات، لوحات المتصدرين، ونموذج اللغة كحكم. التقييم متعدد الخيارات هو طريقة تعتمد على المعايير حيث يجيب النموذج على أسئلة مع خيارات إجابة، وتُقاس الدقة كنسبة الإجابات الصحيحة. يوضح المقال تطبيقًا لهذه الطريقة باستخدام نموذج Qwen3 0.6B وكود PyTorch: حيث يتم تحميل نموذج مُدرب مسبقًا، ويُبنى موجه مع السؤال والخيارات، ويُولد إجابة، ثم تُقارن بالإجابة الصحيحة. بالنسبة للمثال من مجموعة "الرياضيات في المدرسة الثانوية" من MMLU، أعطى النموذج إجابة خاطئة. يُلاحظ أنه عمليًا، تُستخدم أيضًا طرق تعتمد على الاحتمالات اللوغاريتمية، وتُطبق أساليب مختلفة للنماذج الاستدلالية. تتم مناقشة المدققات، لوحات المتصدرين، ونموذج اللغة كحكم بالتفصيل في كتاب المؤلف "بناء نموذج استدلالي (من الصفر)".
المصدر: Sebastian Raschka —
الأصلي
