RechercheModèles 🇷🇺 01.08.2026 20:01

Quantification discrète : la nouvelle frontière de la compression des réseaux neuronaux

PrismMLPrismML
L'article explore le passage des techniques de quantification classiques à la quantification discrète, où les poids sont limités à un petit ensemble de valeurs (binaire, ternaire). Il met en lumière la famille de modèles Bonsai 27B de PrismML, qui utilise des versions binaires et ternaires de Qwen 3.6 27B, atteignant une compression jusqu'à 14 fois tout en conservant une part significative des capacités du modèle original. L'auteur teste la version ternaire, notant une inférence plus rapide mais des baisses de performance inégales dans les tâches complexes, et discute des implications pratiques pour exécuter de grands modèles sur du matériel grand public.
L'article commence par discuter de l'évolution de la quantification des réseaux neuronaux, passant des formats à virgule flottante traditionnels aux types entiers comme INT8 et INT4, puis à la quantification discrète avec des poids binaires (1 bit) et ternaires (1,58 bit). Cette approche réduit radicalement la taille du modèle et permet son déploiement sur du matériel grand public. La famille Bonsai 27B de PrismML, basée sur Qwen 3.6 27B, propose des versions binaire et ternaire qui occupent respectivement 3,8 Go et 7,17 Go, contre 53,8 Go pour l'original. L'entreprise affirme préserver jusqu'à 90 à 95 % des capacités d'origine, mais les tests de l'auteur montrent environ 75 % pour les mathématiques et le codage, et 60 % pour les appels de fonctions multi-agents complexes, tout en restant impressionnants pour un modèle dix fois plus petit. L'auteur note que le modèle ternaire surpasse l'original en vitesse, générant du texte plus rapidement. De plus, un rédacteur spéculatif DSpark est inclus pour augmenter la vitesse de génération de 35 % sans perte de qualité. Cependant, le modèle nécessite un fork spécial de llama.cpp en raison de formats de quantification non standard, que l'auteur montre comment compiler et exécuter. L'auteur conclut que cela représente une réalisation significative, offrant une qualité comparable à celle de modèles quantifiés plus grands tout en tenant dans une mémoire VRAM plus petite, ce qui le rend adapté au déploiement local et potentiellement à des appareils mobiles comme l'iPhone 17 Pro Max.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches