Donanım ve ÇıkarımModeller 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 16 GB VRAM'de: Quant'lar, İnce Ayar, Karşılaştırma ve Gemma-4 Hakkında Birkaç Şey

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Bir geliştirici, oyun kodlarındaki hataları düzeltmek için RTX 5060 Ti 16GB üzerinde yerel olarak çeşitli quantize edilmiş ve ince ayar yapılmış modelleri (Qwen3.5/3.6, Gemma-4) test etti. Sonuçlar, IQ3 gibi düşük quant'ların çalışabileceğini, ancak kalitenin sağlayıcılar ve model sürümleri arasında tahmin edilemez şekilde değiştiğini gösteriyor. İnce ayarlar çoğunlukla zayıf; bir istisna dışında, yazar, kıyaslamalara güvenmek yerine kendi görevlerinizde test etmeyi öneriyor.
Yazar, profesyonel olmayan bir programcı olarak, yapay zeka yardımıyla oyunlar geliştirdi ve modelleri yerel olarak çalıştırmaya karar verdi. Kurulumu Ryzen 5 5600G, 32GB RAM ve RTX 5060 Ti 16GB idi. Qwen3.5 ve Qwen3.6'nın çeşitli quantizasyonlarını (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), Qwen3.5 ve Qwen3.6'nın ince ayar sürümlerini ve Gemma-4 12b'nin QAT ve Q5K_S sürümlerini içeren bir model koleksiyonunu test etti. Test, bir oyundaki hatayı (harita kırpma) düzeltmeyi ve kodu temizlemeyi içeriyordu. Kayda değer sonuçlar: Qwen3.5 27b UD-IQ3XXS sürümü başarılı oldu, Qwen3.5 27b Q3K_S sürümü başarılı oldu ve hatta kodu optimize etti, Qwen3.6 IQ3_S sürümü de başarılı oldu, ancak Qwen3.6'nın UD-IQ3XXS ve Q3K_S sürümleri başarısız oldu ve oyunu bozdu. Gemma-4 12b QAT başarılı olurken, Q5K_S başarısız oldu. İnce ayar sürümler çoğunlukla zayıftı, ancak 'defiant fable' daha hızlı ve daha verimliydi. Yazar, quantizasyon kalitesinin büyük ölçüde sağlayıcıya (Unsloth vs mradermacher) bağlı olduğunu ve i-matrix quantizasyonlarının her zaman daha iyi olmadığını buldu. Yazar, kendi görevlerinizde test yapmanın şart olduğu ve IQ3 gibi düşük quantizasyonların uygulanabilir olduğu sonucuna varıyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler