प्रॉम्प्ट, RAG, या फाइन-ट्यूनिंग: आपके एलएलएम को वास्तव में क्या सीखाता है
इस लेख में, फिनटेक और ई-कॉमर्स के टेक लीड, सर्गेई प्रोशचेव, एलएलएम को डोमेन ज्ञान सिखाने के तीन तरीकों की तुलना करते हैं: संदर्भ के साथ प्रॉम्प्टिंग, RAG, और QLoRA फाइन-ट्यूनिंग। एक मॉडल (Qwen3-8B) और एक GPU (RTX 4090) का उपयोग करके, उन्होंने समान 30 प्रश्नों पर तीनों का परीक्षण किया। परिणाम दिखाते हैं कि तथ्यात्मक प्रश्नों के लिए RAG सबसे अच्छा है, QLoRA प्रारूप और शब्दावली में उत्कृष्ट है, लेकिन अपडेटेड डेटा पर विफल रहता है, और प्रॉम्प्टिंग अच्छा प्रारंभिक बिंदु है लेकिन इसकी सीमाएं हैं।
सर्गेई प्रोशचेव, जो फिनटेक और ई-कॉमर्स में टेक लीड हैं, ने एक प्रयोग किया जिसमें उन्होंने स्थानीय LLM को डोमेन-विशिष्ट ज्ञान सिखाने के तीन तरीकों की तुलना की: संदर्भ के साथ प्रॉम्प्टिंग, RAG (रिट्रीवल-ऑगमेंटेड जनरेशन), और QLoRA के साथ फाइन-ट्यूनिंग। उन्होंने Qwen3-8B मॉडल और 24 GB VRAM वाला एक RTX 4090 इस्तेमाल किया। डोमेन आंतरिक भुगतान दस्तावेज़ीकरण था: लगभग 120 पृष्ठों के विनियम, जिनमें एक्वायरर रिस्पॉन्स कोड, रीट्राय नियम, भुगतान रूटिंग, सीमाएं और अपवाद शामिल थे। उन्होंने तीन प्रकार के 30 प्रश्न बनाए: तथ्यात्मक, सिंथेटिक (जिसमें अनुभागों में संश्लेषण की आवश्यकता होती है), और प्रारूप (आंतरिक घटना रिपोर्ट टेम्पलेट का पालन करना)। प्रॉम्प्टिंग के लिए, उन्होंने पूरे विनियम को संदर्भ में रखा (128K टोकन) और कुल मिलाकर 20 सही उत्तर प्राप्त किए, लेकिन 'लॉस्ट इन द मिडल' और उच्च विलंबता से पीड़ित रहे। RAG के लिए, उन्होंने चंकिंग (500 टोकन ओवरलैप के साथ), BAAI/bge-m3 एम्बेडिंग, और वेक्टर डेटाबेस के रूप में Qdrant का उपयोग किया, जिसमें टॉप-5 चंक प्राप्त किए गए। RAG ने तथ्यात्मक प्रश्नों पर 9/10 स्कोर किया और स्रोत संदर्भ प्रदान किए, लेकिन सिंथेटिक प्रश्नों पर विफल रहा और आंतरिक शब्दावली नहीं सीख सका। QLoRA के लिए, उन्होंने एक मजबूत मॉडल के साथ लगभग 800 प्रश्न-उत्तर जोड़े उत्पन्न किए, उन्हें मैन्युअल रूप से साफ किया, और लगभग 40 मिनट के लिए LoRA एडेप्टर प्रशिक्षित किया। फाइन-ट्यून्ड मॉडल ने प्रारूप प्रश्नों (10/10) में उत्कृष्ट प्रदर्शन किया और सिंथेटिक प्रश्नों (8/10) में सुधार किया, लेकिन अपडेट किए गए तथ्यों पर विफल रहा, डेटासेट से पुरानी सीमाओं के साथ उत्तर दिया। लेखक ने निष्कर्ष निकाला कि ये दृष्टिकोण प्रतिस्पर्धी नहीं हैं बल्कि परतें हैं: प्रॉम्प्टिंग से शुरू करें, फिर तथ्यात्मक सटीकता और स्रोत संदर्भों के लिए RAG जोड़ें, और जब मॉडल को एक विशिष्ट शैली या शब्दावली अपनाने की आवश्यकता हो तो फाइन-ट्यूनिंग का उपयोग करें। अध्ययन में यह भी उल्लेख किया गया है कि Unsloth Studio और H2O LLM Studio GUI-आधारित फाइन-ट्यूनिंग प्रदान करते हैं, और Predibase द्वारा LoRA Land अनुसंधान ने दिखाया कि फाइन-ट्यून्ड मॉडल संकीर्ण कार्यों पर GPT-4 को पार कर सकते हैं।
स्रोत: Habr — хаб ИИ —
मूल
