Diskrete Quantisierung: Die nächste Grenze bei der Kompression neuronaler Netze
PrismML
Der Artikel untersucht den Wandel von klassischen Quantisierungstechniken hin zur diskreten Quantisierung, bei der die Gewichte auf eine kleine Menge von Werten (binär, ternär) begrenzt sind. Er beleuchtet die Bonsai-27B-Modellfamilie von PrismML, die binäre und ternäre Versionen von Qwen 3.6 27B verwendet und dabei eine bis zu 14-fache Kompression erreicht, während ein erheblicher Teil der Fähigkeiten des ursprünglichen Modells erhalten bleibt. Der Autor testet die ternäre Version und stellt eine schnellere Inferenz, aber ungleichmäßige Leistungseinbußen bei komplexen Aufgaben fest. Zudem werden die praktischen Auswirkungen für den Betrieb großer Modelle auf Consumer-Hardware diskutiert.
Der Artikel beginnt mit der Diskussion über die Entwicklung der Quantisierung neuronaler Netze, die sich von traditionellen Gleitkommaformaten zu Integer-Typen wie INT8 und INT4 und dann zu diskreter Quantisierung mit binären (1-Bit) und ternären (1,58-Bit) Gewichten entwickelt hat. Dieser Ansatz reduziert die Modellgröße radikal und ermöglicht den Einsatz auf Consumer-Hardware. Die Bonsai-27B-Familie von PrismML, basierend auf Qwen 3.6 27B, bietet binäre und ternäre Versionen, die 3,8 GB bzw. 7,17 GB belegen, verglichen mit den ursprünglichen 53,8 GB. Das Unternehmen behauptet, bis zu 90-95 % der ursprünglichen Fähigkeiten zu erhalten, aber die Tests des Autors zeigen etwa 75 % für Mathematik und Codierung und 60 % für komplexe Multi-Agenten-Funktionsaufrufe, was dennoch beeindruckend für ein Modell ist, das zehnmal kleiner ist. Der Autor stellt fest, dass das ternäre Modell das ursprüngliche in Bezug auf die Geschwindigkeit übertrifft und Text schneller generiert. Zusätzlich ist ein spekulativer Drafter DSpark enthalten, der die Generierungsgeschwindigkeit um 35 % ohne Qualitätsverlust steigert. Das Modell erfordert jedoch einen speziellen Fork von llama.cpp aufgrund nicht standardmäßiger Quantisierungsformate, dessen Erstellung und Ausführung der Autor demonstriert. Der Autor schlussfolgert, dass dies eine bedeutende Leistung darstellt, die eine Qualität bietet, die mit größeren quantisierten Modellen vergleichbar ist, während sie in kleineren VRAM passt, was sie für lokale Bereitstellung und möglicherweise auf mobilen Geräten wie dem iPhone 17 Pro Max geeignet macht.
Quelle: Habr — хаб ИИ —
Original
