Hardware e InferenciaModelos 🇷🇺 13.08.2026 15:01

Qwen3.5/3.6 en 16 GB de VRAM: cuantizaciones, fine-tuning, comparación y algo sobre Gemma-4

Alibaba/QwenAlibaba/Qwen Google/DeepMindGoogle/DeepMind UnslothUnsloth
Un desarrollador probó varios modelos cuantizados y ajustados (Qwen3.5/3.6, Gemma-4) localmente en una RTX 5060 Ti de 16 GB para corregir errores en su código de juego. Los resultados muestran que las cuantizaciones bajas como IQ3 pueden funcionar, pero la calidad varía de forma impredecible entre proveedores y versiones de modelos. Los fine-tunings son en su mayoría deficientes, con una excepción, y el autor recomienda probar en tus propias tareas en lugar de confiar en los benchmarks.
El autor, un programador no profesional, creó juegos con ayuda de IA y decidió ejecutar modelos localmente. Su configuración era un Ryzen 5 5600G con 32 GB de RAM y una RTX 5060 Ti de 16 GB. Probó un zoológico de modelos, incluyendo Qwen3.5 y Qwen3.6 en varios cuants (IQ3XS, Q3K_S, IQ3_S, IQ3_M, 4bpw), ajustes finos de Qwen3.5 y Qwen3.6, y Gemma-4 12b en QAT y Q5K_S. La prueba consistió en corregir un error en un juego (recorte del mapa) y limpiar el código. Resultados notables: Qwen3.5 27b en UD-IQ3XXS tuvo éxito, Qwen3.5 27b en Q3K_S tuvo éxito e incluso optimizó el código, Qwen3.6 en IQ3_S también tuvo éxito, mientras que Qwen3.6 en UD-IQ3XXS y Q3K_S fallaron y rompieron el juego. Gemma-4 12b QAT tuvo éxito, pero Q5K_S falló. Los ajustes finos fueron en su mayoría deficientes, excepto 'defiant fable', que fue más rápido y eficiente. El autor descubrió que la calidad del cuant depende en gran medida del proveedor (Unsloth frente a mradermacher) y que los cuants con i-matrix no siempre son mejores. El autor concluye que probar en tus propias tareas es esencial, y que los cuants bajos como IQ3 pueden ser viables.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas