InvestigaciónModelos 🇷🇺 01.08.2026 20:01

Cuantización discreta: la nueva frontera en la compresión de redes neuronales

PrismMLPrismML
El artículo explora el cambio de las técnicas de cuantización clásicas a la cuantización discreta, donde los pesos se limitan a un pequeño conjunto de valores (binarios, ternarios). Destaca la familia de modelos Bonsai 27B de PrismML, que utiliza versiones binarias y ternarias de Qwen 3.6 27B, logrando una compresión de hasta 14 veces mientras retiene una parte significativa de las capacidades del modelo original. El autor prueba la versión ternaria, notando una inferencia más rápida pero caídas de rendimiento desiguales en tareas complejas, y discute las implicaciones prácticas para ejecutar modelos grandes en hardware de consumo.
El artículo comienza discutiendo la evolución de la cuantización de redes neuronales, pasando de formatos tradicionales de punto flotante a tipos enteros como INT8 e INT4, y luego a la cuantización discreta con pesos binarios (1 bit) y ternarios (1,58 bits). Este enfoque reduce radicalmente el tamaño del modelo y permite su implementación en hardware de consumo. La familia Bonsai 27B de PrismML, basada en Qwen 3.6 27B, ofrece versiones binarias y ternarias que ocupan 3,8 GB y 7,17 GB respectivamente, en comparación con los 53,8 GB originales. La compañía afirma una preservación de hasta el 90-95% de las capacidades originales, pero las pruebas del autor muestran alrededor del 75% para matemáticas y codificación, y el 60% para llamadas de función multiagente complejas, aunque sigue siendo impresionante para un modelo 10 veces más pequeño. El autor señala que el modelo ternario supera al original en velocidad, generando texto más rápido. Además, se incluye un redactor especulativo DSpark para aumentar la velocidad de generación en un 35% sin pérdida de calidad. Sin embargo, el modelo requiere una bifurcación especial de llama.cpp debido a los formatos de cuantización no estándar, lo que el autor demuestra cómo compilar y ejecutar. El autor concluye que esto representa un logro significativo, ofreciendo una calidad comparable a la de modelos cuantizados más grandes mientras cabe en menos VRAM, lo que lo hace adecuado para implementación local y potencialmente en dispositivos móviles como el iPhone 17 Pro Max.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas