सर्च और RAG सिस्टम के लिए परीक्षण चेकलिस्ट: छह स्तरों की जाँच
सर्च और RAG (रिट्रीवल-ऑग्मेंटेड जेनरेशन) सिस्टम के परीक्षण के लिए एक चेकलिस्ट प्रस्तुत की गई है, जो छह स्तरों की जाँच को कवर करती है — बुनियादी कार्यक्षमता से लेकर अपूर्ण डेटा को संभालने तक। मीट्रिक्स, टूल्स और 50 से अधिक शब्दों का एक शब्दकोष वर्णित है। स्तरों के अनुक्रम के महत्व पर जोर दिया गया है: यदि शून्य स्तर पारित नहीं किया गया है तो RAG का मूल्यांकन करने का कोई मतलब नहीं है।
हबर पर सर्च इंजन और आरएजी आर्किटेक्चर के परीक्षण के लिए एक विस्तृत चेकलिस्ट प्रकाशित की गई है। लेखक जाँच के छह स्तरों की पहचान करते हैं: स्तर 0 — कार्यात्मक (इंजन निर्दिष्ट फ़ील्ड द्वारा पुनर्प्राप्त करता है, टाइपो को सुधारता है, खाली क्वेरी और विशेष वर्णों को संभालता है); स्तर 1 — क्लासिक सूचना पुनर्प्राप्ति मीट्रिक Precision@k, Recall@k, NDCG, MRR, MAP के साथ एक लेबल किए गए गोल्डन क्वेरी सेट पर; स्तर 2 — आरएजी के लिए पुनर्प्राप्त संदर्भ की गुणवत्ता (कॉन्टेक्स्टुअल प्रिसिजन और रिकॉल); स्तर 3 — आरएजी जनरेशन की गुणवत्ता (फेथफुलनेस, हेलुसिनेशन रेट, आंसर रेलेवेंस, कम्प्लीटनेस, उद्धरण सटीकता); स्तर 4 — एजेंसी और नॉलेज ग्राफ नेविगेशन (मल्टी-हॉप, टूल करेक्टनेस, टास्क कम्प्लीशन, प्लान एडहेरेंस); स्तर 5 — अधूरे और ढीले संबंधित डेटा को संभालना (अब्सटेंशन, ओवर-एक्सट्रापोलेशन, पुराने और वर्तमान डेटा के बीच संघर्ष)। प्रत्येक स्तर के लिए अनुशंसित टूल प्रदान किए गए हैं: स्तर 0 के लिए pytest, Hypothesis, Postman, k6; स्तर 1 के लिए ranx, trec_eval; स्तर 2–4 के लिए deepeval, RAGAS, TruLens; स्तर 5 के लिए कस्टम जी-इवैल्यूएशन। विशेष जोर अनुक्रमिक परीक्षण की आवश्यकता पर दिया गया है — यदि सर्च इंजन बुनियादी परीक्षणों में विफल रहता है, जैसे कि टाइपो के कारण किसी दस्तावेज़ को नहीं ढूंढ पाना, तो आरएजी मीट्रिक का मूल्यांकन करने का कोई मतलब नहीं है।
स्रोत: Habr — хаб NLP —
मूल
