التطبيقاتالأبحاث 🇷🇺 27.07.2026 09:05

قائمة فحص اختبار أنظمة البحث وRAG: ستة مستويات من الفحوصات

تُقدَّم قائمة فحص لاختبار أنظمة البحث وRAG (التوليد المعزز بالاسترجاع)، تغطي ستة مستويات من الفحوصات — من الوظائف الأساسية إلى معالجة البيانات غير المكتملة. يتم وصف المقاييس والأدوات ومسرد يضم أكثر من 50 مصطلحًا. يتم التأكيد على أهمية تسلسل المستويات: لا فائدة من تقييم RAG إذا لم يتم اجتياز المستوى الصفري.
نُشرت قائمة مرجعية مفصلة لاختبار محركات البحث وهندسة RAG على منصة Habr. يحدد المؤلفون ستة مستويات من الفحوصات: المستوى 0 — وظيفي (يسترد المحرك البيانات حسب الحقول المحددة، ويصحح الأخطاء الإملائية، ويعالج الاستعلامات الفارغة والأحرف الخاصة)؛ المستوى 1 — استرجاع المعلومات الكلاسيكي باستخدام مقاييس Precision@k و Recall@k و NDCG و MRR و MAP على مجموعة استعلامات ذهبية موسومة؛ المستوى 2 — جودة السياق المسترجع لـ RAG (الدقة السياقية والاستدعاء السياقي)؛ المستوى 3 — جودة التوليد في RAG (الإخلاص، معدل الهلوسة، ملاءمة الإجابة، الاكتمال، دقة الاقتباس)؛ المستوى 4 — الوكالة والتنقل عبر الرسوم البيانية المعرفية (متعدد القفزات، صحة الأداة، إتمام المهمة، الالتزام بالخطة)؛ المستوى 5 — التعامل مع البيانات غير المكتملة وذات الصلة الضعيفة (الامتناع عن الإجابة، الإفراط في الاستقراء، التعارض بين البيانات القديمة والحديثة). لكل مستوى، تُقدم أدوات موصى بها: pytest و Hypothesis و Postman و k6 للمستوى 0؛ و ranx و trec_eval للمستوى 1؛ و deepeval و RAGAS و TruLens للمستويات 2-4؛ و G-Eval المخصص للمستوى 5. يُسلط الضوء بشكل خاص على ضرورة الاختبار التسلسلي — فلا فائدة من تقييم مقاييس RAG إذا فشل محرك البحث في الاختبارات الأساسية، مثل عدم العثور على مستند بسبب خطأ إملائي.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة