Déploiement du modèle 1-bit Bonsai-27B avec PrismML llama.cpp pour l'inférence locale
PrismML
Ce tutoriel détaille le déploiement du modèle de langage Bonsai-27B quantifié en 1 bit à l'aide du fork PrismML de llama.cpp. Il couvre la configuration de l'environnement GPU, la compilation des binaires compatibles CUDA, le téléchargement du modèle GGUF depuis Hugging Face, l'exécution de tests en ligne de commande, le lancement d'un serveur d'inférence local compatible OpenAI, et l'interaction via un client Python prenant en charge le streaming, les conversations multi-tours et la génération de code. Des fonctionnalités optionnelles telles que l'inférence à contexte long, le décodage spéculatif et la vision sont également abordées.
Ce tutoriel décrit le déploiement du modèle Bonsai-27B en 1 bit, qui utilise le format de quantification GGUF Q1_0_g128, via le fork PrismML de llama.cpp. Il commence par vérifier le GPU, installer les dépendances, compiler les binaires d'inférence compatibles CUDA, et télécharger les poids du modèle compressé depuis le Hub Hugging Face. Le modèle est testé à l'aide de llama-cli, puis un serveur d'inférence local compatible OpenAI est lancé. Un client Python est fourni pour interagir avec le serveur, prenant en charge les complétions standard, le streaming, les conversations multi-tours et la génération de code. Les configurations optionnelles incluent l'inférence à contexte long, la mise en cache KV 4 bits, le décodage spéculatif avec un drafter DSpark, et la prise en charge de la vision. Le tutoriel mentionne également la disponibilité d'une variante ternaire pour une qualité supérieure.
Source: MarkTechPost —
original
