मॉडल 🇷🇺 27.07.2026 09:03

RAG: बेंचमार्क कोड से अधिक महत्वपूर्ण हैं। एक बॉट की कहानी जहां 'उचित' सुधारों ने परिणाम खराब कर दिया

एक डेवलपर ने क्रिप्टो चैट को मॉडरेट करने के लिए एक RAG बॉट बनाया, लेकिन पाया कि मानक सुधार — BM25 और एक रीरैंकर — ने केवल मेट्रिक्स को खराब किया। एकमात्र प्रभावी बदलाव कटऑफ थ्रेशोल्ड को कैलिब्रेट करना था। लेख अपने स्वयं के डेटा पर गहन बेंचमार्किंग के महत्व पर जोर देता है।
एक डेवलपर ने क्रिप्टोकरेंसी चैट उपयोगकर्ताओं के लक्षित समर्थन के लिए एक RAG बॉट बनाने का निर्णय लिया: बॉट को समान प्रश्न खोजने और पहले से मौजूद प्रशासक प्रतिक्रियाएं दिखानी थीं। 3.9 मिलियन संदेशों के कॉर्पस और 51 प्रश्नों के मूल्यांकन सेट का उपयोग करते हुए, उन्होंने शुद्ध वेक्टर खोज के लिए hit@3 बेसलाइन 74% मापा। सिस्टम में सुधार के प्रयास में, उन्होंने BM25 के साथ हाइब्रिड खोज और क्रॉस-एन्कोडर रीरैंकर जोड़ा। दोनों परिवर्तनों ने मीट्रिक को कम कर दिया: हाइब्रिड ने 55%, रीरैंकर ने 64%, और हाइब्रिड+रीरैंकर ने 57% दिया। विश्लेषण से पता चला कि BM25 अप्रभावी था क्योंकि नमूना प्रश्न कॉर्पस में सटीक टोकन अनुपस्थित थे, जबकि रीरैंकर ने पहले से अच्छी रैंकिंग को खराब कर दिया। एकमात्र लाभकारी परिवर्तन कटऑफ थ्रेशोल्ड को बॉट की भूमिका के अनुसार समायोजित करना था (अंतिम उत्तरदाता के बजाय एक फॉलबैक के रूप में): इससे बिना अतिरिक्त कोड के उपयोगी आउटपुट में सुधार हुआ। मुख्य निष्कर्ष यह है कि RAG में, उद्योग के डिफ़ॉल्ट नहीं, बल्कि ईमानदार माप और डेटा सफाई मायने रखती है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार