Perangkat Keras & InferensiSumber Terbuka 🇺🇸 28.07.2026 11:02

Menyebarkan Model Bonsai-27B 1-bit dengan PrismML llama.cpp untuk Inferensi Lokal

PrismMLPrismML
Tutorial ini menjelaskan secara rinci tentang penyebaran model bahasa Bonsai-27B yang dikuantisasi 1-bit menggunakan fork PrismML dari llama.cpp. Tutorial ini mencakup pengaturan lingkungan GPU, kompilasi biner yang mendukung CUDA, mengunduh model GGUF dari Hugging Face, menjalankan tes baris perintah, meluncurkan server inferensi lokal yang kompatibel dengan OpenAI, dan berinteraksi melalui klien Python yang mendukung streaming, percakapan multi-putaran, dan pembuatan kode. Fitur opsional seperti inferensi konteks panjang, decoding spekulatif, dan visi juga dibahas.
Tutorial ini menjelaskan tentang penerapan model Bonsai-27B 1-bit, yang menggunakan format kuantisasi GGUF Q1_0_g128, melalui fork PrismML dari llama.cpp. Tutorial ini dimulai dengan memverifikasi GPU, menginstal dependensi, mengompilasi biner inferensi yang mendukung CUDA, dan mengunduh bobot model terkompresi dari Hugging Face Hub. Model diuji menggunakan llama-cli, kemudian server inferensi lokal yang kompatibel dengan OpenAI diluncurkan. Klien Python disediakan untuk berinteraksi dengan server, mendukung penyelesaian standar, streaming, percakapan multi-giliran, dan pembuatan kode. Konfigurasi opsional mencakup inferensi konteks panjang, caching KV 4-bit, decoding spekulatif dengan drafter DSpark, dan dukungan visi. Tutorial ini juga mencatat ketersediaan varian terner untuk kualitas yang lebih tinggi.
Sumber: MarkTechPost — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru