OnderzoekModellen 🇷🇺 01.08.2026 20:01

Discrete kwantisering: de volgende grens in het comprimeren van neurale netwerken

PrismMLPrismML
Het artikel verkent de verschuiving van klassieke kwantiseringstechnieken naar discrete kwantisering, waarbij gewichten worden beperkt tot een kleine set waarden (binair, ternair). Het belicht de Bonsai 27B-modelfamilie van PrismML, die binaire en ternaire versies van Qwen 3.6 27B gebruikt, met een compressie tot 14x terwijl een aanzienlijk deel van de oorspronkelijke mogelijkheden behouden blijft. De auteur test de ternaire versie en merkt snellere inferentie op, maar ongelijke prestatievermindering bij complexe taken, en bespreekt de praktische implicaties voor het draaien van grote modellen op consumentenhardware.
Het artikel begint met een bespreking van de evolutie van kwantisering in neurale netwerken, die zich beweegt van traditionele floating-point-formaten naar integer-types zoals INT8 en INT4, en vervolgens naar discrete kwantisering met binaire (1-bit) en ternaire (1,58-bit) gewichten. Deze aanpak verkleint de modelomvang radicaal en maakt implementatie op consumentenhardware mogelijk. De Bonsai 27B-familie van PrismML, gebaseerd op Qwen 3.6 27B, biedt binaire en ternaire versies die respectievelijk 3,8 GB en 7,17 GB in beslag nemen, vergeleken met de oorspronkelijke 53,8 GB. Het bedrijf claimt tot 90-95% behoud van de oorspronkelijke capaciteiten, maar de tests van de auteur tonen ongeveer 75% voor wiskunde en coderen, en 60% voor complexe multi-agent function calling, terwijl dat nog steeds indrukwekkend is voor een model dat 10 keer kleiner is. De auteur merkt op dat het ternaire model de oorspronkelijke versie overtreft in snelheid, omdat het sneller tekst genereert. Daarnaast is er een speculatieve drafter DSpark toegevoegd om de generatiesnelheid met 35% te verhogen zonder kwaliteitsverlies. Het model vereist echter een speciale fork van llama.cpp vanwege niet-standaard kwantisatieformaten, en de auteur laat zien hoe je die kunt bouwen en uitvoeren. De auteur concludeert dat dit een significante prestatie vertegenwoordigt, die kwaliteit biedt die vergelijkbaar is met grotere gekwantiseerde modellen terwijl het in minder VRAM past, waardoor het geschikt is voor lokale implementatie en mogelijk voor mobiele apparaten zoals de iPhone 17 Pro Max.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws