Hardware e InferenciaCódigo Abierto 🇺🇸 28.07.2026 11:02

Despliegue del modelo Bonsai-27B de 1 bit con PrismML llama.cpp para inferencia local

PrismMLPrismML
Este tutorial detalla el despliegue del modelo de lenguaje Bonsai-27B cuantizado a 1 bit utilizando el fork de PrismML de llama.cpp. Cubre la configuración del entorno GPU, la compilación de binarios con soporte CUDA, la descarga del modelo GGUF desde Hugging Face, la ejecución de pruebas de línea de comandos, el lanzamiento de un servidor de inferencia local compatible con OpenAI y la interacción mediante un cliente Python que admite transmisión, conversación de múltiples turnos y generación de código. También se discuten características opcionales como la inferencia de contexto largo, la decodificación especulativa y la visión.
El tutorial describe el despliegue del modelo Bonsai-27B de 1 bit, que utiliza el formato de cuantización GGUF Q1_0_g128, mediante el fork PrismML de llama.cpp. Comienza verificando la GPU, instalando dependencias, compilando binarios de inferencia habilitados para CUDA y descargando los pesos comprimidos del modelo desde Hugging Face Hub. El modelo se prueba usando llama-cli, y luego se lanza un servidor de inferencia local compatible con OpenAI. Se proporciona un cliente Python para interactuar con el servidor, que admite finalizaciones estándar, transmisión, conversaciones de múltiples turnos y generación de código. Las configuraciones opcionales incluyen inferencia de contexto largo, almacenamiento en caché de KV de 4 bits, decodificación especulativa con un drafter DSpark y soporte de visión. El tutorial también señala la disponibilidad de una variante ternaria para una mayor calidad.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas