التطبيقاتالأبحاث 🇷🇺 27.07.2026 09:05

قائمة التحقق لاختبار أنظمة البحث و RAG: ستة مستويات من الفحوصات

تم تقديم قائمة تحقق لاختبار أنظمة البحث و RAG، تتكون من ستة مستويات من الفحوصات - من الوظائف الأساسية إلى معالجة البيانات غير الكاملة. تم وصف المقاييس والأدوات وقائمة مصطلحات تضم أكثر من 50 مصطلحاً. يتم التأكيد على أهمية تسلسل المستويات: لا معنى لتقييم RAG إذا لم يتم اجتياز المستوى الصفري.
نشرت مدونة هابر قائمة مراجعة مفصلة لاختبار محركات البحث وهندسة RAG. يحدد المؤلفون ستة مستويات من الاختبارات: المستوى 0 — وظيفي (المحرك يعثر على الحقول المحددة، يصحح الأخطاء الإملائية، يعالج الاستعلام الفارغ والرموز الخاصة)؛ المستوى 1 — استرجاع المعلومات الكلاسيكي بمقاييس Precision@k وRecall@k وNDCG وMRR وMAP على مجموعة استعلامات ذهبية موسومة؛ المستوى 2 — جودة السياق المسترجع لـ RAG (الدقة والاستدعاء السياقيان)؛ المستوى 3 — جودة التوليد في RAG (الإخلاص، معدل الهلوسة، ملاءمة الإجابة، الاكتمال، دقة الاستشهاد)؛ المستوى 4 — الوكالة والتنقل عبر الرسم البياني المعرفي (القفز المتعدد، صحة الأداة، إكمال المهمة، الالتزام بالخطة)؛ المستوى 5 — التعامل مع البيانات غير الكاملة وضعيفة الترابط (الامتناع عن التخمين، الإفراط في الاستقراء، تعارض البيانات القديمة والحديثة). لكل مستوى، تم سرد الأدوات الموصى بها: pytest وHypothesis وPostman وk6 للمستوى 0؛ ranx وtrec_eval للمستوى 1؛ deepeval وRAGAS وTruLens للمستويات 2–4؛ وG-Eval المخصص للمستوى 5. تم التأكيد بشكل خاص على ضرورة إجراء الاختبارات بشكل تسلسلي — فليس من المنطقي تقييم مقاييس RAG إذا كان محرك البحث لا يجتاز الاختبارات الأساسية، مثل عدم العثور على مستند بسبب خطأ إملائي.
المصدر: Habr — хаб NLP — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة