AraştırmaModeller 🇷🇺 01.08.2026 20:01

Ayrık Niceleme: Sinir Ağlarını Sıkıştırmanın Yeni Sınırı

PrismMLPrismML
Makale, klasik niceleme tekniklerinden, ağırlıkların küçük bir değer kümesiyle (ikili, üçlü) sınırlandığı ayrık nicelemeye geçişi inceliyor. PrismML'den Bonsai 27B model ailesini vurguluyor; bu modeller, Qwen 3.6 27B'nin ikili ve üçlü sürümlerini kullanarak orijinal modelin yeteneklerinin önemli bir bölümünü korurken 14 kata kadar sıkıştırma sağlıyor. Yazar, üçlü sürümü test ederek daha hızlı çıkarım elde ettiğini ancak karmaşık görevlerde düzensiz performans düşüşleri gözlemlediğini belirtiyor ve büyük modelleri tüketici donanımında çalıştırmanın pratik sonuçlarını tartışıyor.
Makale, sinir ağı nicelemesinin evrimini tartışarak başlıyor: geleneksel kayan nokta formatlarından INT8 ve INT4 gibi tam sayı tiplerine ve ardından ikili (1-bit) ve üçlü (1.58-bit) ağırlıklarla kesikli nicelemeye geçiş. Bu yaklaşım model boyutunu radikal şekilde azaltıyor ve tüketici donanımlarında dağıtımı mümkün kılıyor. PrismML'den Qwen 3.6 27B tabanlı Bonsai 27B ailesi, orijinal 53.8 GB'a kıyasla sırasıyla 3.8 GB ve 7.17 GB yer kaplayan ikili ve üçlü sürümler sunuyor. Şirket, orijinal yeteneklerin %90-95'ine kadar korunduğunu iddia ediyor, ancak yazarın testleri matematik ve kodlama için yaklaşık %75, karmaşık çoklu ajan fonksiyon çağrısı için %60 gösteriyor; yine de 10 kat daha küçük bir model için etkileyici. Yazar, üçlü modelin hız konusunda orijinali geride bıraktığını, metni daha hızlı ürettiğini belirtiyor. Ayrıca, üretim hızını kalite kaybı olmaksızın %35 artıran spekülatif bir taslak oluşturucu olan DSpark da dahil edilmiş. Ancak model, standart olmayan niceleme formatları nedeniyle llama.cpp'nin özel bir çatalını gerektiriyor; yazar bunun nasıl derlenip çalıştırılacağını gösteriyor. Yazar, bunun önemli bir başarıyı temsil ettiği, daha büyük nicelenmiş modellere benzer kalite sunarken daha küçük VRAM'e sığdığı ve yerel dağıtım için uygun olduğu, hatta iPhone 17 Pro Max gibi mobil cihazlarda çalıştırılabileceği sonucuna varıyor.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler