研究模型 🇷🇺 01.08.2026 20:01

离散量化:压缩神经网络的下一个前沿

PrismMLPrismML
本文探讨了从经典量化技术向离散量化的转变,其中权重被限制在少量取值(二进制、三进制)内。文章重点介绍了PrismML推出的Bonsai 27B模型系列,该系列采用了Qwen 3.6 27B的二进制和三进制版本,在保留原始模型大部分能力的同时实现了高达14倍的压缩。作者测试了三进制版本,注意到推理速度更快,但在复杂任务中性能下降不均匀,并讨论了在消费级硬件上运行大型模型的实际意义。
文章首先讨论了神经网络量化的发展,从传统的浮点格式转向整数类型,如INT8和INT4,然后发展到二值(1比特)和三值(1.58比特)权重的离散量化。这种方法大幅减小了模型体积,使其能够在消费级硬件上部署。来自PrismML、基于Qwen 3.6 27B的Bonsai 27B系列提供了二值和三值版本,分别占用3.8 GB和7.17 GB,而原始模型大小为53.8 GB。该公司声称能保留原始能力的90%至95%,但作者测试显示数学和编码能力约为75%,复杂的多智能体函数调用能力为60%,对于一个体积小10倍的模型来说,这仍然令人印象深刻。作者指出,三值模型在速度上优于原始模型,生成文本更快。此外,还包含一个投机性的草稿模型DSpark,可将生成速度提升35%,且不损失质量。然而,由于该模型采用非标准的量化格式,需要特殊的llama.cpp分支版本,作者展示了如何构建和运行它。作者总结道,这是一项重大成就,在保持与较大量化模型相当质量的同时,能适配更小的显存,使其适合本地部署,甚至可能用于iPhone 17 Pro Max等移动设备。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻