مقارنة بين LLM-wiki و RAG: طرق توليد الإجابات للمستندات المؤسسية
OpenAI
Google DeepMind
Anthropic
قارن الكاتب بين LLM-wiki (المعتمد على وكيل ويكي) ونظام RAG بسيط باستخدام مستند اصطناعي يُدعى "التوجيه 401". أظهرت النتائج أن LLM-wiki تفوق باستمرار على RAG في اكتمال الإجابات (الاستدعاء)، بينما كان الفرق في الدقة ضئيلاً. بلغت تكلفة بناء الويكي أقل من 3.7 دولار.
أجرى المؤلف تجربة لمقارنة نهجين لتوليد الإجابات المستندة إلى المستندات: "إلإلإم-ويكي" (المستوحى من فكرة أندريه كارباثي) ونظام استرجاع مُعزَّز بالتوليد (RAG) بسيط مزود بمسترد متجهات. كان النص المصدر مستندًا اصطناعيًا للشركة بعنوان "التوجيه 401" بطول حوالي 100,000 حرف، أُعد بواسطة نموذج "جيمّا 4:31b". تم تصنيع الأسئلة (20 سؤالًا واقعيًا و20 سؤالًا قائمًا على الحالة) بواسطة نموذج "جي بي تي-5.1". لبناء الويكي، تم تقسيم المستند المصدر إلى 25 جزءًا (24 مادة بالإضافة إلى صفحة عنوان)، ثم أُضيف الملف "إيجنتس إم دي" (AGENTS.md) في تطبيق "أوبسيديان"، وباستخدام "كلود كود" (سونيت 5)، تم إنشاء 32 صفحة ويكي في 20 دقيقة بتكلفة أقل من 3.7 دولار. تألف وكيل الويكي من أربعة مكونات: الملاح (جي بي تي-4.1 ميني)، والرابط (جي بي تي-4.1 ميني)، ومجمع السياق، والمركّب (جي بي تي-4.1). استخدم نظامRAG لانج تشين (LangChain) وكرومادي بي (ChromaDB) وفاست إيه بي آي (FastAPI) والتضمينات المحلية؛ تم إنشاء الأجزاء بناءً على المستوى الثاني من ترقيم المواد (144 جزءًا إجمالًا). استخدم التقييم مقاييس الدقة والاستدعاء: تمت مقارنة الحقائق من الإجابات بمرجع—إجابة نموذج لغة كبير (LLM) اطلع على النص بأكمله. أظهرت النتائج من ثلاثة تكوينات لوكيل الويكي (بدون وصول إلى المصدر، مع وصول، مع وصول ورابط) أن متوسط الاستدعاء لـ "إلإلإم-ويكي" بلغ حوالي 0.72 مقارنة بـ 0.54-0.57 لنظام RAG، مع قيم احتمالية (p-values) تتراوح من 10⁻⁸ إلى 10⁻¹¹ باستخدام اختبار ويلكوكسون (Wilcoxon test). بالنسبة للدقة، كان الفرق ذا دلالة إحصائية فقط في تكوينين (p < 0.05) واختفى تمامًا عند إضافة الرابط (p = 0.348). لم يوفر الرابط تحسنًا ذا دلالة إحصائية. ساعد الوصول إلى المصدر بشكل معتدل في الأسئلة الواقعية، لكن التأثير كان هامشيًا. يلاحظ المؤلف أن الاستنتاجات تقتصر على مجموعة البيانات هذه.
المصدر: Habr — хаб NLP —
الأصلي
