Hardware & InferentieModellen 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 op 16 GB VRAM: quants, fine-tunes, vergelijking en iets over Gemma-4

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Een ontwikkelaar testte verschillende gekwantiseerde en fijngetunede modellen (Qwen3.5/3.6, Gemma-4) lokaal op een RTX 5060 Ti 16GB om bugs in hun gamecode te repareren. Resultaten tonen aan dat lage quants zoals IQ3 kunnen werken, maar de kwaliteit varieert onvoorspelbaar tussen providers en modelversies. Fine-tunes zijn meestal slecht, met één uitzondering, en de auteur raadt aan om op je eigen taken te testen in plaats van benchmarks te vertrouwen.
De auteur, een niet-professionele programmeur, creëerde games met behulp van AI-assistentie en besloot modellen lokaal te draaien. Hun opstelling bestond uit een Ryzen 5 5600G met 32GB RAM en een RTX 5060 Ti 16GB. Ze testten een hele zoo aan modellen, waaronder Qwen3.5 en Qwen3.6 in verschillende quantisaties (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), fine-tunes van Qwen3.5 en Qwen3.6, en Gemma-4 12b in QAT en Q5K_S. De test bestond uit het oplossen van een bug in een game (kaartclipping) en het opschonen van code. Opvallende resultaten: Qwen3.5 27b in UD-IQ3XXS slaagde, Qwen3.5 27b in Q3K_S slaagde en optimaliseerde zelfs code, Qwen3.6 in IQ3_S slaagde ook, terwijl Qwen3.6 in UD-IQ3XXS en Q3K_S faalden en de game brak. Gemma-4 12b QAT slaagde, maar Q5K_S faalde. Fine-tunes waren over het algemeen slecht, behalve 'defiant fable', die sneller en efficiënter was. De auteur ontdekte dat de kwaliteit van de quantisatie sterk afhangt van de aanbieder (Unsloth versus mradermacher) en dat i-matrix-quantisaties niet altijd beter zijn. De auteur concludeert dat het essentieel is om op je eigen taken te testen, en dat lage quantisaties zoals IQ3 levensvatbaar kunnen zijn.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws