LLM-wiki बनाम RAG: कॉर्पोरेट दस्तावेज़ों के लिए उत्तर निर्माण विधियों की तुलना
OpenAI
Google DeepMind
Anthropic
लेखक ने LLM-wiki (एक विकी एजेंट पर आधारित) की तुलना एक सरल RAG सिस्टम से की, जिसमें "डायरेक्टिव 401" नामक सिंथेटिक दस्तावेज़ का उपयोग किया गया। परिणामों से पता चला कि LLM-wiki उत्तर पूर्णता (रिकॉल) में RAG से लगातार बेहतर प्रदर्शन करता है, जबकि सटीकता में अंतर नगण्य था। विकी बनाने की लागत $3.7 से कम थी।
लेखक ने दस्तावेज़-आधारित उत्तर उत्पन्न करने के दो दृष्टिकोणों की तुलना करते हुए एक प्रयोग किया: एलएलएम-विकी (एंद्रेई कारपैथी के विचार से प्रेरित) और एक सरल आरएजी प्रणाली जिसमें वेक्टर पुनर्प्राप्तकर्ता (रिट्रीवर) का उपयोग किया गया। स्रोत पाठ 'डायरेक्टिव 401' नामक एक काल्पनिक कॉर्पोरेट दस्तावेज़ था, जो लगभग 1,00,000 वर्णों का था और जेम्मा4:31बी मॉडल द्वारा तैयार किया गया था। प्रश्न (20 तथ्यात्मक और 20 केस-आधारित) जीपीटी-5.1 मॉडल द्वारा संश्लेषित किए गए थे। विकी बनाने के लिए स्रोत दस्तावेज़ को 25 भागों (24 लेख और एक शीर्षक पृष्ठ) में विभाजित किया गया, फिर ऑब्सिडियन में फ़ाइल एजेंट्स.एमडी जोड़ा गया, और क्लॉड कोड (सॉनेट 5) का उपयोग करके 20 मिनट में $3.7 से कम लागत पर 32 विकी पृष्ठ उत्पन्न किए गए। विकी एजेंट में चार घटक थे: नेविगेटर (जीपीटी-4.1-मिनी), लिंकर (जीपीटी-4.1-मिनी), कॉन्टेक्स्ट कलेक्टर और सिंथेसाइज़र (जीपीटी-4.1)। आरएजी प्रणाली में लैंगचेन, क्रोमाडीबी, फ़ास्टएपीआई और स्थानीय एम्बेडिंग का उपयोग किया गया; खंड (चंक) लेख क्रमांकन के दूसरे स्तर (कुल 144 खंड) के आधार पर बनाए गए। मूल्यांकन में प्रेसिजन (परिशुद्धता) और रिकॉल (प्रासंगिकता) मीट्रिक का उपयोग किया गया: उत्तरों से तथ्यों की तुलना एक संदर्भ के साथ की गई—वह उत्तर जो एक एलएलएम ने पूरा पाठ देखने के बाद दिया। विकी एजेंट के तीन कॉन्फ़िगरेशन (स्रोत तक पहुँच न होना, पहुँच होना, पहुँच और लिंकर के साथ) से परिणामों से पता चला कि एलएलएम-विकी के लिए माध्यिका रिकॉल लगभग 0.72 था, जबकि आरएजी के लिए यह 0.54–0.57 था, और विलकॉक्सन परीक्षण का उपयोग करते हुए पी-मान 10⁻⁸ से 10⁻¹¹ तक थे। प्रेसिजन के लिए, अंतर केवल दो कॉन्फ़िगरेशन में सांख्यिकीय रूप से महत्वपूर्ण था (पी < 0.05) और लिंकर जोड़ने पर पूरी तरह से गायब हो गया (पी = 0.348)। लिंकर ने सांख्यिकीय रूप से महत्वपूर्ण सुधार प्रदान नहीं किया। तथ्य प्रश्नों पर स्रोत तक पहुँच से मामूली मदद मिली, लेकिन प्रभाव सीमांत था। लेखक ने नोट किया कि निष्कर्ष इस डेटासेट तक सीमित हैं।
स्रोत: Habr — хаб NLP —
मूल
