RTX 3050 पर रिकर्सिव llama.cpp इंजन: Qwen 32B और 7B कोडर टेस्ट — 3x गुणवत्ता बूस्ट और मेमोरी की भूख

MistralMistral
यह एक लेख का दूसरा भाग है जो llama.cpp के एक फोर्क के बारे में है जो रिकर्सिव प्रोसेसिंग मोड जोड़ता है। लेखक ने RTX 3050 6 GB पर Qwen 32B और Qwen 2.5 Coder 7B का परीक्षण किया, मानक इंजन (D=0) की तुलना बेहतर फोर्क (D=12) से की। रिकर्सिव इंजन ने कोड की गुणवत्ता में काफी सुधार किया (3.1 गुना तक सही फिक्स) लेकिन जनरेशन गति में लगभग 11-13% की लागत आई और VRAM उपयोग बढ़ गया।
लेखक llama.cpp के एक फ़ोर्क का परीक्षण जारी रखता है जो एक पुनरावर्ती मोड (D=12 नामित) को मानक इंजन (D=0) के विरुद्ध लागू करता है। परीक्षण RTX 3050 6 GB वीडियो कार्ड पर चलाए गए, जिसमें सभी मॉडल Q4 परिमाणीकरण में थे। बड़े Qwen 32B-A3B मॉडल के लिए, आसान बेंचमार्क कार्यों पर दोनों इंजनों ने समान परिणाम दिए, लेकिन पुनरावर्ती संस्करण थोड़ा धीमा था। कठिन खंड पर, पुनरावर्ती इंजन ने कोड समीक्षा कार्य में लगभग 3.1 गुना अधिक त्रुटियों को ठीक किया, हालांकि इसमें 17% अधिक समय लगा। लेखक नोट करता है कि पुनरावर्ती इंजन 'आलसी कोड जनरेशन' की समस्या को हल करता है, जो खंडित स्निपेट्स के बजाय पूर्ण मोनोलिथिक स्क्रिप्ट तैयार करता है। Qwen 2.5 Coder 7B Instruct के लिए, पुनरावर्ती संस्करण ने कोड समीक्षा में बेहतर प्रदर्शन किया (एक और बग मिला), फुलस्टैक विकास में यह पूरी तरह से आवश्यकताओं को संतुष्ट करता था जबकि मानक संस्करण नहीं करता था, और 2D गेम परीक्षण में यह ड्रा रहा, जिसमें पुनरावर्ती इंजन ने गैर-मौजूद टैग से परहेज किया और बुनियादी गेम तर्क लागू किया। Mistral 7B Instruct v0.2 के लिए, पुनरावर्ती इंजन ने सुरक्षा में काफी सुधार किया (98% संरक्षित), फुलस्टैक प्लेटफॉर्म को नाटकीय रूप से बेहतर बनाया (2.2 गुना सुधार, 100% व्यावसायिक तर्क), और स्वच्छ गेम लेआउट तैयार किया। मुख्य दोष गति में लगभग 13% की कमी और वीआरएएम खपत में वृद्धि है। लेखक फ़ोर्क रिपॉजिटरी और विस्तृत परिणामों के साथ Google Drive से लिंक करता है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार