Qwen3.5/3.6 在 16 GB 显存上的表现:量化、微调、对比,以及关于 Gemma-4 的一些内容
Alibaba/Qwen
Google/DeepMind
Unsloth
一位开发者在 RTX 5060 Ti 16 GB 显卡本地测试了多种量化及微调模型(Qwen3.5/3.6、Gemma-4),以修复其游戏代码中的错误。结果显示,IQ3 等低比特量化模型可以使用,但质量在不同提供商和模型版本间不稳定。微调模型大多表现不佳,仅有一个例外,作者建议针对自身任务进行测试,而非盲目相信基准测试。
作者是一名非专业程序员,利用AI辅助创作游戏,并决定在本地运行模型。其配置为锐龙5 5600G、32GB内存和RTX 5060 Ti 16GB。他们测试了一系列模型,包括不同量化版本的Qwen3.5和Qwen3.6(IQ3XS、Q3K_S、IQ3_S、IQ3_M、4bpw),以及Qwen3.5和Qwen3.6的精调版本,还有Gemma-4 12b的QAT和Q5K_S版本。测试内容涉及修复游戏中的缺陷(地图裁剪问题)和清理代码。值得注意的是:Qwen3.5 27b的UD-IQ3XXS版本成功;Qwen3.5 27b的Q3K_S版本也成功,甚至优化了代码;Qwen3.6的IQ3_S版本也成功,而其UD-IQ3XXS和Q3K_S版本则失败并破坏了游戏。Gemma-4 12b的QAT版本成功,但Q5K_S版本失败。精调模型大多表现不佳,但'defiant fable'除外,它更快且更高效。作者发现,量化质量在很大程度上取决于提供方(Unsloth vs mradermacher),并且i-matrix量化并不总是更优。作者总结道,用自己的任务进行测试至关重要,且像IQ3这样的低量化版本是可用的。
来源: Habr — хаб ИИ —
原文
