Qwen3.5/3.6 على ذاكرة 16 جيجابايت: الكميات، الضبط الدقيق، المقارنة، وقليل عن Gemma-4

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
اختبر أحد المطورين نماذج مختلفة مضغوطة ومدربة بدقة (Qwen3.5/3.6، Gemma-4) محليًا على بطاقة RTX 5060 Ti بسعة 16 جيجابايت لإصلاح أخطاء في كود لعبته. أظهرت النتائج أن الكميات المنخفضة مثل IQ3 يمكن أن تعمل، لكن الجودة تتفاوت بشكل غير متوقع بين مقدمي الخدمات وإصدارات النماذج. معظم الضبط الدقيق ضعيف، مع استثناء واحد، ويوصي المؤلف باختبار النماذج على مهامك الخاصة بدلاً من الثقة في المؤشرات المعيارية.
الكاتب، وهو مبرمج غير محترف، أنشأ ألعابًا بمساعدة الذكاء الاصطناعي وقرر تشغيل النماذج محليًا. كان إعداده يتكون من معالج Ryzen 5 5600G مع 32 جيجابايت من ذاكرة الوصول العشوائي وبطاقة رسوميات RTX 5060 Ti 16 جيجابايت. اختبر مجموعة كبيرة من النماذج، بما في ذلك Qwen3.5 و Qwen3.6 بإصدارات كمية مختلفة (IQ3XS، Q3K_S، IQ3_S، IQ3_M، 4bpw)، والنسخ المضبوطة بدقة من Qwen3.5 و Qwen3.6، و Gemma-4 12b بإصدارات QAT و Q5K_S. تضمن الاختبار إصلاح خطأ في لعبة (اقتطاع الخريطة) وتنظيف الكود. النتائج البارزة: نجح Qwen3.5 27b في إصدار UD-IQ3XXS، ونجح Qwen3.5 27b في إصدار Q3K_S بل وحسّن الكود، ونجح Qwen3.6 في إصدار IQ3_S أيضًا، بينما فشل Qwen3.6 في إصدارَي UD-IQ3XXS و Q3K_S وكسر اللعبة. نجح Gemma-4 12b في إصدار QAT لكن فشل في Q5K_S. كانت النسخ المضبوطة ضعيفة في معظمها، باستثناء نسخة 'defiant fable' التي كانت أسرع وأكثر كفاءة. وجد الكاتب أن جودة النسخ الكمية تعتمد بشكل كبير على المزود (Unsloth مقابل mradermacher) وأن النسخ الكمية المحسّنة بمصفوفة المعلومات (i-matrix) ليست دائمًا أفضل. يخلص الكاتب إلى أن اختبار النماذج على مهامك الخاصة أمر ضروري، وأن النسخ الكمية المنخفضة مثل IQ3 يمكن أن تكون قابلة للاستخدام في الواقع.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة