Hardware & InferenzOpen Source 🇺🇸 28.07.2026 11:02

Bereitstellung des 1-Bit-Bonsai-27B-Modells mit PrismML llama.cpp für lokale Inferenz

PrismMLPrismML
Dieses Tutorial beschreibt die Bereitstellung des 1-Bit-quantisierten Sprachmodells Bonsai-27B unter Verwendung des PrismML-Forks von llama.cpp. Es behandelt die Einrichtung der GPU-Umgebung, das Kompilieren von CUDA-fähigen Binärdateien, das Herunterladen des GGUF-Modells von Hugging Face, das Ausführen von Befehlszeilentests, das Starten eines OpenAI-kompatiblen lokalen Inferenzservers sowie die Interaktion über einen Python-Client, der Streaming, Mehrfachgespräche und Codegenerierung unterstützt. Optionale Funktionen wie Langkontext-Inferenz, spekulative Dekodierung und Vision werden ebenfalls diskutiert.
Das Tutorial beschreibt die Bereitstellung des 1-Bit-Modells Bonsai-27B, das das GGUF-Quantisierungsformat Q1_0_g128 verwendet, über den PrismML-Fork von llama.cpp. Es beginnt mit der Überprüfung der GPU, der Installation von Abhängigkeiten, dem Kompilieren von CUDA-fähigen Inferenz-Binärdateien und dem Herunterladen der komprimierten Modellgewichte vom Hugging Face Hub. Das Modell wird mit llama-cli getestet, anschließend wird ein OpenAI-kompatibler lokaler Inferenzserver gestartet. Ein Python-Client wird bereitgestellt, um mit dem Server zu interagieren, und unterstützt Standard-Vervollständigungen, Streaming, mehrteilige Konversationen und Codegenerierung. Optionale Konfigurationen umfassen Long-Context-Inferenz, 4-Bit-KV-Caching, spekulative Dekodierung mit einem DSpark-Drafter und Vision-Unterstützung. Das Tutorial weist auch auf die Verfügbarkeit einer ternären Variante für höhere Qualität hin.
Quelle: MarkTechPost — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten