Qwen3.5/3.6 em 16 GB de VRAM: Quantização, Fine-Tuning, Comparação e um Pouco sobre Gemma-4
Alibaba/Qwen
Google/DeepMind
Unsloth
Um desenvolvedor testou vários modelos quantizados e ajustados (Qwen3.5/3.6, Gemma-4) localmente em uma RTX 5060 Ti de 16 GB para corrigir bugs em seu código de jogo. Os resultados mostram que quantizações baixas, como IQ3, podem funcionar, mas a qualidade varia de forma imprevisível entre provedores e versões de modelo. Fine-tunes são em sua maioria ruins, com uma exceção, e o autor recomenda testar em suas próprias tarefas em vez de confiar em benchmarks.
O autor, um programador não profissional, criou jogos com assistência de IA e decidiu executar modelos localmente. Sua configuração era um Ryzen 5 5600G com 32GB de RAM e uma RTX 5060 Ti 16GB. Ele testou um zoológico de modelos, incluindo Qwen3.5 e Qwen3.6 em várias quantizações (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), fine-tunes de Qwen3.5 e Qwen3.6, e Gemma-4 12b em QAT e Q5K_S. O teste envolveu corrigir um bug em um jogo (recorte do mapa) e limpar o código. Resultados notáveis: Qwen3.5 27b em UD-IQ3XXS teve sucesso, Qwen3.5 27b em Q3K_S teve sucesso e até otimizou o código, Qwen3.6 em IQ3_S também teve sucesso, enquanto Qwen3.6 em UD-IQ3XXS e Q3K_S falhou e quebrou o jogo. Gemma-4 12b QAT teve sucesso, mas Q5K_S falhou. Os fine-tunes foram em sua maioria ruins, exceto 'defiant fable', que foi mais rápido e eficiente. O autor descobriu que a qualidade da quantização depende fortemente do provedor (Unsloth vs mradermacher) e que quantizações com i-matrix nem sempre são melhores. O autor conclui que testar em suas próprias tarefas é essencial, e quantizações baixas como IQ3 podem ser viáveis.
Fonte: Habr — хаб ИИ —
original
