RAG: Measurements Matter More Than Code. The Story of a Bot Where 'Correct' Improvements Worsened Results
A developer built a RAG bot for moderating crypto chats but found that standard improvements—BM25 and a reranker—only degraded metrics. The only change that worked was calibrating the cutoff threshold. The article emphasizes the importance of careful measurements on one's own data.
एक डेवलपर ने क्रिप्टो चैट उपयोगकर्ताओं के लिए एक लक्षित समर्थन RAG बॉट बनाने का निर्णय लिया: बॉट को समान प्रश्न खोजने और एडमिन के तैयार उत्तर दिखाने चाहिए। 3.9 मिलियन संदेशों के कोर्पस और 51 प्रश्नों के eval सेट पर, उसने शुद्ध वेक्टर खोज का आधारभूत hit@3 मापा - 74%। सिस्टम को बेहतर बनाने के प्रयास में, उसने BM25 के साथ हाइब्रिड खोज और cross-encoder री-रैंकर जोड़ा। दोनों बदलावों ने मीट्रिक को गिरा दिया: हाइब्रिड ने 55% दिया, री-रैंकर ने 64%, हाइब्रिड+री-रैंकर ने 57%। विश्लेषण से पता चला कि BM25 कोर्पस में सटीक टोकन की कमी के कारण अप्रभावी है, और री-रैंकर पहले से अच्छी रैंकिंग को खराब करता है। एकमात्र उपयोगी परिवर्तन बॉट की भूमिका (एक सुरक्षा जाल, अंतिम उत्तरदाता नहीं) के अनुसार कट-ऑफ थ्रेशोल्ड सेट करना था: इसने बिना अतिरिक्त कोड के उपयोगी आउटपुट बढ़ाया। मुख्य निष्कर्ष - RAG में औद्योगिक डिफॉल्ट नहीं, बल्कि ईमानदार माप और डेटा सफाई महत्वपूर्ण हैं।
स्रोत: Habr — хаб ИИ —
मूल
