शोधमॉडल 🇷🇺 27.07.2026 02:04

LLM-wiki बनाम RAG: कॉर्पोरेट दस्तावेज़ों के लिए उत्तर निर्माण विधियों की तुलना

OpenAIOpenAI Google DeepMindGoogle DeepMind AnthropicAnthropic
लेखक ने LLM-wiki (एक विकी एजेंट पर आधारित) की तुलना एक सरल RAG सिस्टम से की, जिसमें "डायरेक्टिव 401" नामक सिंथेटिक दस्तावेज़ का उपयोग किया गया। परिणामों से पता चला कि LLM-wiki उत्तर पूर्णता (रिकॉल) में RAG से लगातार बेहतर प्रदर्शन करता है, जबकि सटीकता में अंतर नगण्य था। विकी बनाने की लागत $3.7 से कम थी।
लेखक ने दस्तावेज़-आधारित उत्तर उत्पन्न करने के दो दृष्टिकोणों की तुलना करते हुए एक प्रयोग किया: एलएलएम-विकी (एंद्रेई कारपैथी के विचार से प्रेरित) और एक सरल आरएजी प्रणाली जिसमें वेक्टर पुनर्प्राप्तकर्ता (रिट्रीवर) का उपयोग किया गया। स्रोत पाठ 'डायरेक्टिव 401' नामक एक काल्पनिक कॉर्पोरेट दस्तावेज़ था, जो लगभग 1,00,000 वर्णों का था और जेम्मा4:31बी मॉडल द्वारा तैयार किया गया था। प्रश्न (20 तथ्यात्मक और 20 केस-आधारित) जीपीटी-5.1 मॉडल द्वारा संश्लेषित किए गए थे। विकी बनाने के लिए स्रोत दस्तावेज़ को 25 भागों (24 लेख और एक शीर्षक पृष्ठ) में विभाजित किया गया, फिर ऑब्सिडियन में फ़ाइल एजेंट्स.एमडी जोड़ा गया, और क्लॉड कोड (सॉनेट 5) का उपयोग करके 20 मिनट में $3.7 से कम लागत पर 32 विकी पृष्ठ उत्पन्न किए गए। विकी एजेंट में चार घटक थे: नेविगेटर (जीपीटी-4.1-मिनी), लिंकर (जीपीटी-4.1-मिनी), कॉन्टेक्स्ट कलेक्टर और सिंथेसाइज़र (जीपीटी-4.1)। आरएजी प्रणाली में लैंगचेन, क्रोमाडीबी, फ़ास्टएपीआई और स्थानीय एम्बेडिंग का उपयोग किया गया; खंड (चंक) लेख क्रमांकन के दूसरे स्तर (कुल 144 खंड) के आधार पर बनाए गए। मूल्यांकन में प्रेसिजन (परिशुद्धता) और रिकॉल (प्रासंगिकता) मीट्रिक का उपयोग किया गया: उत्तरों से तथ्यों की तुलना एक संदर्भ के साथ की गई—वह उत्तर जो एक एलएलएम ने पूरा पाठ देखने के बाद दिया। विकी एजेंट के तीन कॉन्फ़िगरेशन (स्रोत तक पहुँच न होना, पहुँच होना, पहुँच और लिंकर के साथ) से परिणामों से पता चला कि एलएलएम-विकी के लिए माध्यिका रिकॉल लगभग 0.72 था, जबकि आरएजी के लिए यह 0.54–0.57 था, और विलकॉक्सन परीक्षण का उपयोग करते हुए पी-मान 10⁻⁸ से 10⁻¹¹ तक थे। प्रेसिजन के लिए, अंतर केवल दो कॉन्फ़िगरेशन में सांख्यिकीय रूप से महत्वपूर्ण था (पी < 0.05) और लिंकर जोड़ने पर पूरी तरह से गायब हो गया (पी = 0.348)। लिंकर ने सांख्यिकीय रूप से महत्वपूर्ण सुधार प्रदान नहीं किया। तथ्य प्रश्नों पर स्रोत तक पहुँच से मामूली मदद मिली, लेकिन प्रभाव सीमांत था। लेखक ने नोट किया कि निष्कर्ष इस डेटासेट तक सीमित हैं।
स्रोत: Habr — хаб NLP — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार