Quantização Discreta: A Próxima Fronteira na Compressão de Redes Neurais
PrismML
O artigo explora a transição das técnicas clássicas de quantização para a quantização discreta, onde os pesos são limitados a um pequeno conjunto de valores (binários, ternários). Ele destaca a família de modelos Bonsai 27B da PrismML, que usa versões binárias e ternárias do Qwen 3.6 27B, alcançando até 14x de compressão, mantendo uma parte significativa das capacidades do modelo original. O autor testa a versão ternária, notando inferência mais rápida, mas quedas irregulares de desempenho em tarefas complexas, e discute as implicações práticas para executar modelos grandes em hardware de consumo.
O artigo começa discutindo a evolução da quantização de redes neurais, passando dos tradicionais formatos de ponto flutuante para tipos inteiros como INT8 e INT4, e depois para a quantização discreta com pesos binários (1-bit) e ternários (1,58-bit). Essa abordagem reduz drasticamente o tamanho do modelo e permite a implantação em hardware de consumo. A família Bonsai 27B da PrismML, baseada no Qwen 3.6 27B, oferece versões binária e ternária que ocupam 3,8 GB e 7,17 GB, respectivamente, em comparação com os 53,8 GB originais. A empresa afirma preservar até 90-95% das capacidades originais, mas os testes do autor mostram cerca de 75% para matemática e codificação, e 60% para chamadas de funções multiagentes complexas, ainda assim impressionante para um modelo 10 vezes menor. O autor observa que o modelo ternário supera o original em velocidade, gerando texto mais rápido. Além disso, um redator especulativo DSpark é incluído para aumentar a velocidade de geração em 35% sem perda de qualidade. No entanto, o modelo requer um fork especial do llama.cpp devido aos formatos de quantização não padrão, que o autor demonstra como compilar e executar. O autor conclui que isso representa uma conquista significativa, oferecendo qualidade comparável a modelos quantizados maiores, enquanto cabe em VRAM menor, tornando-o adequado para implantação local e potencialmente em dispositivos móveis como o iPhone 17 Pro Max.
Fonte: Habr — хаб ИИ —
original
