Развертывание 1-битной модели Bonsai-27B с PrismML llama.cpp для локального вывода

PrismML
Это руководство подробно описывает развертывание 1-битной квантованной языковой модели Bonsai-27B с использованием форка PrismML от llama.cpp. Оно охватывает настройку GPU-окружения, компиляцию двоичных файлов с поддержкой CUDA, загрузку GGUF-модели с Hugging Face, запуск тестов из командной строки, запуск локального сервера вывода, совместимого с OpenAI, и взаимодействие через Python-клиент, поддерживающий потоковую передачу, многопоточный чат и генерацию кода. Также обсуждаются дополнительные функции, такие как вывод с длинным контекстом, спекулятивное декодирование и зрение.
В этом руководстве описывается развертывание 1-битной модели Bonsai-27B, использующей формат квантования GGUF Q1_0_g128, с помощью форка llama.cpp под названием PrismML. Сначала проверяется видеокарта, устанавливаются зависимости, компилируются бинарные файлы инференса с поддержкой CUDA и загружаются сжатые веса модели из Hugging Face Hub. Модель тестируется с помощью llama-cli, затем запускается
Показать ещё ↓
Источник: MarkTechPost — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости