Diskrete Quantisierung: Die nächste Grenze bei der Kompression neuronaler Netze
Der Artikel untersucht den Wandel von klassischen Quantisierungstechniken hin zur diskreten Quantisierung, bei der die Gewichte auf eine kleine Menge von Werten (binär, ternär) begrenzt sind. Er beleuchtet die Bonsai-27B-Modellfamilie von PrismML, die binäre und ternäre Versionen von Qwen 3.6 27B verwendet und dabei eine bis zu 14-fache Kompression erreicht, während ein erheblicher Teil der Fähigkeiten des ursprünglichen Modells erhalten bleibt. Der Autor testet die ternäre Version und stellt eine schnellere Inferenz, aber ungleichmäßige Leistungseinbußen bei komplexen Aufgaben fest. Zudem werden die praktischen Auswirkungen für den Betrieb großer Modelle auf Consumer-Hardware diskutiert.
PrismML
