PrismML llama.cpp के साथ स्थानीय इन्फरेंस के लिए 1-बिट Bonsai-27B मॉडल तैनात करना

PrismMLPrismML
यह ट्यूटोरियल PrismML llama.cpp फोर्क का उपयोग करके 1-बिट क्वांटाइज़्ड Bonsai-27B भाषा मॉडल को तैनात करने का विवरण देता है। इसमें GPU वातावरण सेटअप, CUDA-सक्षम बाइनरी संकलन, Hugging Face से GGUF मॉडल डाउनलोड करना, कमांड-लाइन परीक्षण चलाना, OpenAI-संगत स्थानीय इन्फरेंस सर्वर लॉन्च करना, और स्ट्रीमिंग, मल्टी-टर्न चैट और कोड जनरेशन का समर्थन करने वाले Python क्लाइंट के माध्यम से इंटरैक्ट करना शामिल है। वैकल्पिक सुविधाएँ जैसे लंबे-संदर्भ इन्फरेंस, स्पेकुलेटिव डिकोडिंग, और विज़न पर भी चर्चा की गई है।
यह ट्यूटोरियल 1-बिट Bonsai-27B मॉडल की तैनाती का वर्णन करता है, जो Q1_0_g128 GGUF क्वांटाइजेशन प्रारूप का उपयोग करता है, जिसे llama.cpp के PrismML फोर्क के माध्यम से तैनात किया जाता है। यह GPU की जांच करके, निर्भरताओं को स्थापित करके, CUDA-सक्षम इन्फ्रेंस बाइनरीज़ को संकलित करके, और Hugging Face Hub से संपीड़ित मॉडल वेट्स को डाउनलोड करके शुरू होता है। मॉडल का परीक्षण llama-cli का उपयोग करके किया जाता है, फिर एक OpenAI-संगत स्थानीय इन्फ्रेंस सर्वर लॉन्च किया जाता है। सर्वर के साथ बातचीत करने के लिए एक Python क्लाइंट प्रदान किया जाता है, जो मानक पूर्णताओं, स्ट्रीमिंग, बहु-टर्न वार्तालापों और कोड जनरेशन का समर्थन करता है। वैकल्पिक कॉन्फ़िगरेशन में लंबे-संदर्भ इन्फ्रेंस, 4-बिट KV कैशिंग, DSpark ड्राफ्टर के साथ स्पेकुलेटिव डिकोडिंग, और विज़न समर्थन शामिल हैं। ट्यूटोरियल उच्च गुणवत्ता के लिए एक टर्नरी वैरिएंट की उपलब्धता पर भी ध्यान देता है।
स्रोत: MarkTechPost — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार