النماذج 🇷🇺 27.07.2026 09:03

RAG: المعايير أهم من الكود. قصة بوت حيث أدى التحسين "السليم" إلى تفاقم النتيجة

قام مطور ببناء بوت RAG للإشراف على محادثات الكريبتو، لكنه وجد أن التحسينات المعيارية — BM25 ووحدة إعادة الترتيب — أضرت فقط بالمقاييس. التغيير الوحيد الفعال كان معايرة حد القطع. تؤكد المقالة على أهمية المقارنة المرجعية الشاملة على بياناتك الخاصة.
شرع مطور في بناء روبوت RAG لتقديم دعم موجه لمستخدمي دردشة العملات الرقمية: كان من المفترض أن يجد الروبوت استعلامات مشابهة ويعرض ردودًا إدارية موجودة مسبقًا. باستخدام مجموعة من 3.9 مليون رسالة ومجموعة تقييم من 51 سؤالًا، قاس معدل hit@3 الأساسي للبحث المتجه الخالص عند 74%. في محاولة لتحسين النظام، أضاف بحثًا هجينًا مع BM25 ومعيد ترتيب مشفر متقاطع. أدى كلا التغييرين إلى خفض المقياس: الهجين أعطى 55%، ومعيد الترتيب 64%، والهجين مع معيد الترتيب 57%. أظهر التحليل أن BM25 كان غير فعال بسبب غياب الرموز الدقيقة في مجموعة الأسئلة النموذجية، بينما أفسد معيد الترتيب ترتيبًا جيدًا بالفعل. التغيير الوحيد المفيد كان تعديل عتبة القطع لتناسب دور الروبوت (كحل احتياطي، وليس كمُجيب نهائي): هذا حسن المخرجات المفيدة دون الحاجة إلى كود إضافي. الاستنتاج الرئيسي هو أن ما يهم في RAG ليس الإعدادات الافتراضية الصناعية، بل القياسات الصادقة وتنظيف البيانات.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة