Donanım ve ÇıkarımAçık Kaynak 🇺🇸 28.07.2026 11:02

1-bit Bonsai-27B Modelinin PrismML llama.cpp ile Yerel Çıkarım İçin Dağıtımı

PrismMLPrismML
Bu eğitim, PrismML llama.cpp çatalını kullanarak 1-bit quantize edilmiş Bonsai-27B dil modelinin dağıtımını detaylandırıyor. GPU ortamı kurulumu, CUDA destekli ikili dosyaların derlenmesi, Hugging Face'ten GGUF modelinin indirilmesi, komut satırı testlerinin çalıştırılması, OpenAI uyumlu yerel çıkarım sunucusunun başlatılması ve akış, çoklu tur sohbet ve kod üretimini destekleyen bir Python istemcisi ile etkileşim konularını kapsar. Uzun bağlam çıkarımı, spekülatif kod çözme ve görüntü işleme gibi isteğe bağlı özellikler de tartışılır.
Bu eğitim, PrismML'nin llama.cpp çatalı aracılığıyla, Q1_0_g128 GGUF niceleme formatını kullanan 1 bitlik Bonsai-27B modelinin dağıtımını anlatmaktadır. GPU'nun doğrulanması, bağımlılıkların kurulması, CUDA destekli çıkarım ikili dosyalarının derlenmesi ve model ağırlıklarının Hugging Face Hub'dan sıkıştırılmış olarak indirilmesiyle başlar. Model, llama-cli kullanılarak test edilir ve ardından OpenAI uyumlu yerel bir çıkarım sunucusu başlatılır. Sunucuyla etkileşim kurmak için standart tamamlamaları, akışı, çok turlu sohbetleri ve kod üretimini destekleyen bir Python istemcisi sağlanır. İsteğe bağlı yapılandırmalar arasında uzun bağlam çıkarımı, 4 bit KV önbelleği, DSpark taslaklayıcısı ile spekülatif kod çözme ve görüntü desteği yer alır. Eğitim ayrıca daha yüksek kalite için üçlü (ternary) bir varyantın mevcut olduğunu da not eder.
Kaynak: MarkTechPost — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler