16 GB VRAM पर Qwen3.5/3.6: क्वांट, फाइन-ट्यून, तुलना, और Gemma-4 के बारे में थोड़ा

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
एक डेवलपर ने अपने गेम कोड में बग ठीक करने के लिए RTX 5060 Ti 16GB पर विभिन्न क्वांटिज्ड और फाइन-ट्यून किए गए मॉडल (Qwen3.5/3.6, Gemma-4) का स्थानीय रूप से परीक्षण किया। परिणाम बताते हैं कि IQ3 जैसे कम क्वांट काम कर सकते हैं, लेकिन गुणवत्ता प्रदाताओं और मॉडल संस्करणों के बीच अप्रत्याशित रूप से भिन्न होती है। फाइन-ट्यून ज्यादातर खराब हैं, एक अपवाद के साथ, और लेखक बेंचमार्क पर भरोसा करने के बजाय अपने स्वयं के कार्यों पर परीक्षण करने की सलाह देते हैं।
लेखक, जो एक गैर-पेशेवर प्रोग्रामर हैं, ने AI सहायता से गेम बनाए और मॉडलों को स्थानीय रूप से चलाने का निर्णय लिया। उनका सेटअप Ryzen 5 5600G, 32GB RAM और RTX 5060 Ti 16GB था। उन्होंने विभिन्न क्वांट्स (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw) में Qwen3.5 और Qwen3.6 सहित कई मॉडलों का परीक्षण किया, साथ ही Qwen3.5 और Qwen3.6 के फाइन-ट्यून्स और QAT और Q5K_S में Gemma-4 12b का भी परीक्षण किया। परीक्षण में एक गेम में बग (मैप क्लिपिंग) को ठीक करना और कोड को साफ करना शामिल था। उल्लेखनीय परिणाम: UD-IQ3XXS में Qwen3.5 27b सफल रहा, Q3K_S में Qwen3.5 27b सफल रहा और उसने कोड को अनुकूलित भी किया, IQ3_S में Qwen3.6 भी सफल रहा, जबकि UD-IQ3XXS और Q3K_S में Qwen3.6 विफल रहा और गेम को तोड़ दिया। Gemma-4 12b QAT सफल रहा लेकिन Q5K_S विफल रहा। फाइन-ट्यून्स में ज्यादातर खराब प्रदर्शन रहा, सिवाय 'डिफिएंट फेबल' के जो तेज़ और अधिक कुशल था। लेखक ने पाया कि क्वांट की गुणवत्ता प्रदाता (Unsloth बनाम mradermacher) पर काफी निर्भर करती है और i-matrix क्वांट्स हमेशा बेहतर नहीं होते। लेखक ने निष्कर्ष निकाला कि अपने स्वयं के कार्यों पर परीक्षण करना आवश्यक है और IQ3 जैसे कम क्वांट्स व्यवहार्य हो सकते हैं।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार