LLMs का मूल्यांकन करने के चार मुख्य दृष्टिकोण: बेंचमार्क से जज मॉडल तक
यह लेख बड़े भाषा मॉडलों (LLMs) के मूल्यांकन के चार मुख्य तरीकों का अवलोकन प्रस्तुत करता है: बहुविकल्पीय मूल्यांकन (MMLU), सत्यापनकर्ता, लीडरबोर्ड और LLM-एक-जज के रूप में। प्रत्येक विधि का विस्तार से वर्णन किया गया है और Qwen3 0.6B मॉडल पर आधारित कोड उदाहरणों के साथ चित्रित किया गया है। यह सामग्री सेबेस्टियन रश्का के एक लेख पर आधारित है।
सेबेस्टियन रास्का के लेख में बड़े भाषा मॉडल (एलएलएम) के मूल्यांकन के चार मुख्य दृष्टिकोण बताए गए हैं: बहुविकल्पी मूल्यांकन (जैसे एमएमएलयू बेंचमार्क), सत्यापनकर्ता, लीडरबोर्ड, और एलएलएम-एज़-ए-जज। बहुविकल्पी मूल्यांकन एक बेंचमार्क-उन्मुख विधि है जिसमें मॉडल उत्तर विकल्पों के साथ प्रश्नों का उत्तर देता है, और सटीकता को सही उत्तरों के अनुपात के रूप में मापा जाता है। लेख में क्वेन3 0.6बी मॉडल और पायटॉर्च कोड का उपयोग करके इस विधि के कार्यान्वयन को प्रदर्शित किया गया है: एक पूर्व-प्रशिक्षित मॉडल लोड किया जाता है, प्रश्न और विकल्पों के साथ एक प्रॉम्प्ट बनाया जाता है, एक उत्तर उत्पन्न किया जाता है, और उसकी तुलना सही उत्तर से की जाती है। एमएमएलयू के 'हाई स्कूल गणित' उपसमूह के उदाहरण के लिए, मॉडल ने गलत उत्तर दिया। यह ध्यान दिया गया है कि व्यवहार में, लॉग प्रायिकताओं पर आधारित विधियों का भी उपयोग किया जाता है, और तर्क मॉडल के लिए अलग-अलग दृष्टिकोण लागू किए जाते हैं। सत्यापनकर्ता, लीडरबोर्ड और एलएलएम-एज़-ए-जज पर लेखक की पुस्तक 'बिल्ड अ रीज़निंग मॉडल (फ्रॉम स्क्रैच)' में विस्तार से चर्चा की गई है।
स्रोत: Sebastian Raschka —
मूल
