Qwen3.5/3.6 sur 16 Go de VRAM : quants, fine-tuning, comparaison, et un mot sur Gemma-4
Alibaba/Qwen
Google/DeepMind
Unsloth
Un développeur a testé divers modèles quantifiés et affinés (Qwen3.5/3.6, Gemma-4) localement sur une RTX 5060 Ti 16 Go pour corriger des bugs dans son code de jeu. Les résultats montrent que les quants faibles comme IQ3 peuvent fonctionner, mais la qualité varie de manière imprévisible entre les fournisseurs et les versions de modèles. Les affinements sont généralement de mauvaise qualité, à une exception près, et l'auteur recommande de tester sur vos propres tâches plutôt que de se fier aux benchmarks.
L'auteur, un programmeur non professionnel, a créé des jeux avec l'aide de l'IA et a décidé d'exécuter les modèles localement. Sa configuration comprenait un Ryzen 5 5600G avec 32 Go de RAM et une RTX 5060 Ti 16 Go. Il a testé une multitude de modèles, notamment Qwen3.5 et Qwen3.6 en différentes quantifications (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), des affinages de Qwen3.5 et Qwen3.6, ainsi que Gemma-4 12b en QAT et Q5K_S. Le test consistait à corriger un bug dans un jeu (découpage de carte) et à nettoyer le code. Résultats notables : Qwen3.5 27b en UD-IQ3XXS a réussi, Qwen3.5 27b en Q3K_S a réussi et a même optimisé le code, Qwen3.6 en IQ3_S a également réussi, tandis que Qwen3.6 en UD-IQ3XXS et Q3K_S a échoué et a cassé le jeu. Gemma-4 12b QAT a réussi mais Q5K_S a échoué. Les affinages étaient pour la plupart médiocres, sauf 'defiant fable' qui était plus rapide et plus efficace. L'auteur a constaté que la qualité de la quantification dépend fortement du fournisseur (Unsloth vs mradermacher) et que les quantifications i-matrix ne sont pas toujours meilleures. L'auteur conclut qu'il est essentiel de tester sur ses propres tâches, et que les quantifications faibles comme IQ3 peuvent être viables.
Source: Habr — хаб ИИ —
original
