Kuantisasi Diskret: Batas Baru dalam Kompresi Jaringan Saraf
PrismML
Artikel ini mengeksplorasi pergeseran dari teknik kuantisasi klasik ke kuantisasi diskret, di mana bobot dibatasi pada sekumpulan nilai kecil (biner, terner). Artikel ini menyoroti keluarga model Bonsai 27B dari PrismML, yang menggunakan versi biner dan terner dari Qwen 3.6 27B, mencapai kompresi hingga 14x sambil mempertahankan sebagian besar kemampuan model aslinya. Penulis menguji versi terner, mencatat inferensi yang lebih cepat tetapi penurunan kinerja yang tidak merata pada tugas-tugas kompleks, dan membahas implikasi praktis untuk menjalankan model besar pada perangkat keras konsumen.
Artikel ini dimulai dengan membahas evolusi kuantisasi jaringan saraf, yang beralih dari format floating-point tradisional ke tipe integer seperti INT8 dan INT4, dan kemudian ke kuantisasi diskrit dengan bobot biner (1-bit) dan terner (1,58-bit). Pendekatan ini secara radikal mengurangi ukuran model dan memungkinkan penerapan pada perangkat keras konsumen. Keluarga Bonsai 27B dari PrismML, yang didasarkan pada Qwen 3.6 27B, menawarkan versi biner dan terner yang masing-masing menempati 3,8 GB dan 7,17 GB, dibandingkan dengan ukuran asli 53,8 GB. Perusahaan mengklaim dapat mempertahankan hingga 90-95% kemampuan asli, tetapi pengujian penulis menunjukkan sekitar 75% untuk matematika dan pengkodean, serta 60% untuk pemanggilan fungsi multi-agen yang kompleks, meskipun masih mengesankan untuk model yang sepuluh kali lebih kecil. Penulis mencatat bahwa model terner mengungguli model asli dalam hal kecepatan, menghasilkan teks lebih cepat. Selain itu, penyusun spekulatif bernama DSpark disertakan untuk meningkatkan kecepatan generasi sebesar 35% tanpa kehilangan kualitas. Namun, model ini memerlukan fork khusus dari llama.cpp karena format kuantisasi yang tidak standar, yang penulis tunjukkan cara membangun dan menjalankannya. Penulis menyimpulkan bahwa ini merupakan pencapaian yang signifikan, menawarkan kualitas yang sebanding dengan model terkuantisasi yang lebih besar sambil muat dalam VRAM yang lebih kecil, sehingga cocok untuk penerapan lokal dan berpotensi pada perangkat seluler seperti iPhone 17 Pro Max.
Sumber: Habr — хаб ИИ —
asli
