PrismML llama.cppを使用した1ビットBonsai-27Bモデルのローカル推論デプロイ
PrismML
このチュートリアルでは、PrismMLフォークのllama.cppを使用して、1ビット量子化されたBonsai-27B言語モデルをデプロイする方法を詳しく説明します。GPU環境のセットアップ、CUDA対応バイナリのコンパイル、Hugging FaceからのGGUFモデルのダウンロード、コマンドラインテストの実行、OpenAI互換のローカル推論サーバーの起動、ストリーミング、マルチターンチャット、コード生成をサポートするPythonクライアントを介した対話について説明します。オプション機能として、ロングコンテキスト推論、投機的復号化、ビジョンについても説明します。
このチュートリアルでは、Q1_0_g128 GGUF量子化形式を使用する1ビットBonsai-27Bモデルを、PrismMLフォークのllama.cppを介してデプロイする方法について説明しています。まず、GPUの確認、依存関係のインストール、CUDA対応推論バイナリのコンパイル、Hugging Face Hubからの圧縮モデルウェイトのダウンロードから始めます。モデルはllama-cliを使用してテストされ、その後OpenAI互換のローカル推論サーバーが起動されます。Pythonクライアントが提供され、標準の補完、ストリーミング、マルチターン会話、コード生成をサポートします。オプションの構成には、長いコンテキスト推論、4ビットKVキャッシュ、DSparkドラフターによる投機的復号化、ビジョンサポートが含まれます。また、チュートリアルでは、高品質のために三値バリアントが利用可能であることも記載されています。
出典: MarkTechPost —
原文
