بناء مجموعة تقييم صادقة لأنظمة RAG: كيفية جمع أول 100-300 حالة دون خداع نفسك
Microsoft
تناقش المقالة أهمية إنشاء مجموعة تقييم يدوية لأنظمة RAG، منفصلة عن اختبارات الدخان وبيانات التدريب. تقترح جمع 100-300 حالة مختارة بعناية عبر عدة سيناريوهات، ووضع علامات على استرجاع المعلومات وتوليد الإجابات بشكل منفصل، واستخدام مقاييس مثل Recall@k وMRR@k وnDCG@k. البيانات الاصطناعية والمعايير العامة غير كافية لتقييم الاسترجاع في المجالات المتخصصة.
يؤكد المؤلف أن المعايير العامة مثل MTEB وBEIR لا تضمن جودة الاسترجاع في المهام الخاصة بالمجالات، كما أن البيانات الاصطناعية قد تؤدي إلى صياغات مثالية بشكل مفرط. بدلاً من ذلك، يوصي ببناء مجموعة تقييم يدوية من 100 إلى 300 حالة، مع بداية عملية تتكون من 120 حالة مستمدة من السجلات والوثائق ومقابلات الخبراء والمرشحين الاصطناعيين بعد مراجعتها. يجب أن تتضمن كل حالة حقولاً مثل الاستعلام والسياق ومعرفات المستندات المتوقعة ومقاطع الأدلة الذهبية والحقائق المتوقعة وقابلية الإجابة وسبب الأهمية. يجب تقسيم المجموعة إلى 6-8 شرائح تغطي الكيانات الدقيقة وإعادة الصياغة والمقاطع الطويلة والجداول والإصدارات وحالات عدم وجود إجابة وسوء الصياغة والسيناريوهات الحساسة. يجب تقييم الاسترجاع وتوليد الإجابات بشكل منفصل، مع مقاييس استرجاع تشمل Recall@k وMRR@k وnDCG@k، ومقاييس إجابة تشمل الاستناد إلى الأدلة والاكتمال وملاءمة الإجابة والامتناع الصحيح عن الإجابة. يشدد المؤلف على أنه بالنسبة لشريحة عدم وجود إجابة، فإن مقياس الاستدعاء القياسي لا معنى له، ويقترح بوابة إصدار منفصلة. كما يحذر من استخدام بيانات التدريب في مجموعة التقييم ويقترح التحقق من صحة استخدام نموذج اللغة كحكم على مجموعة فرعية يدوية.
المصدر: Habr — хаб ИИ —
الأصلي
