शोध 🇷🇺 15.08.2026 04:02

एक ईमानदार RAG मूल्यांकन सेट बनाना: पहले 100-300 मामलों को बिना खुद को धोखा दिए कैसे एकत्र करें

MicrosoftMicrosoft
लेख RAG प्रणालियों के लिए एक मैनुअल मूल्यांकन सेट बनाने के महत्व पर चर्चा करता है, जो स्मोक टेस्ट और प्रशिक्षण डेटा से अलग हो। यह कई परिदृश्यों में 100-300 सावधानीपूर्वक चयनित मामलों को एकत्र करने, पुनर्प्राप्ति और उत्तर निर्माण को अलग-अलग लेबल करने, और Recall@k, MRR@k, और nDCG@k जैसे मेट्रिक्स का उपयोग करने का प्रस्ताव करता है। सिंथेटिक डेटा और सार्वजनिक बेंचमार्क डोमेन-विशिष्ट पुनर्प्राप्ति मूल्यांकन के लिए अपर्याप्त हैं।
लेखक का तर्क है कि MTEB और BEIR जैसे सार्वजनिक बेंचमार्क डोमेन-विशिष्ट कार्यों पर अच्छे रिट्रीवल की गारंटी नहीं देते हैं, और सिंथेटिक डेटा अत्यधिक साफ-सुथरे निरूपण की ओर ले जा सकता है। इसके बजाय, वे 100-300 मामलों का एक मैनुअल इवैल सेट बनाने की सलाह देते हैं, जिसकी व्यावहारिक शुरुआत लॉग, दस्तावेज़ीकरण, विशेषज्ञ साक्षात्कार और समीक्षा के बाद सिंथेटिक उम्मीदवारों से प्राप्त 120 मामलों से होती है। प्रत्येक मामले में क्वेरी, परिदृश्य, अपेक्षित दस्तावेज़ आईडी, गोल्ड एविडेंस स्पैन, अपेक्षित तथ्य, उत्तरदेयता और यह महत्वपूर्ण क्यों है जैसे फ़ील्ड शामिल होने चाहिए। सेट को 6-8 स्लाइस में विभाजित किया जाना चाहिए जिसमें सटीक संस्थाएं, व्याख्या (पैराफ्रेज़िंग), लंबे खंड, तालिकाएं, संस्करण, कोई-उत्तर-नहीं मामले, खराब शब्दांकन और संवेदनशील परिदृश्य शामिल हों। रिट्रीवल और उत्तर निर्माण का अलग-अलग मूल्यांकन किया जाना चाहिए, जिसमें रिट्रीवल मेट्रिक्स में रिकॉल@k, MRR@k और nDCG@k शामिल हैं, और उत्तर मेट्रिक्स में ग्राउंडेडनेस, पूर्णता, उत्तर प्रासंगिकता और सही परहेज (अब्स्टेंशन) शामिल हैं। लेखक जोर देते हैं कि कोई-उत्तर-नहीं स्लाइस के लिए, मानक रिकॉल अर्थहीन है और एक अलग रिलीज़ गेट सुझाते हैं। वे इवैल सेट में प्रशिक्षण डेटा का उपयोग करने के खिलाफ चेतावनी भी देते हैं और मैनुअल सबसेट पर LLM-एज़-ए-जज को मान्य करने का सुझाव देते हैं।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार