نشر نموذج Bonsai-27B بتقنية 1-bit باستخدام PrismML llama.cpp للاستدلال المحلي
PrismML
يشرح هذا البرنامج التعليمي نشر نموذج اللغة Bonsai-27B المضغوط بتقنية 1-bit باستخدام نسخة PrismML من llama.cpp. يغطي إعداد بيئة وحدة معالجة الرسوميات، وتجميع ملفات ثنائية متوافقة مع CUDA، وتنزيل نموذج GGUF من Hugging Face، وإجراء اختبارات سطر الأوامر، وإطلاق خادم استدلال محلي متوافق مع OpenAI، والتفاعل عبر عميل Python يدعم البث والمحادثة متعددة الأدوار وتوليد الأكواد. كما يناقش ميزات اختيارية مثل الاستدلال طويل السياق، وفك الترميز التخميني، والرؤية.
يصف هذا البرنامج التعليمي نشر نموذج Bonsai-27B أحادي البت، والذي يستخدم تنسيق تكميم Q1_0_g128 الخاص بـ GGUF، عبر فرع PrismML من مشروع llama.cpp. يبدأ البرنامج بالتحقق من وحدة معالجة الرسومات، وتثبيت التبعيات، وتجميع ملفات الاستدلال الثنائية التي تدعم CUDA، وتنزيل أوزان النموذج المضغوطة من Hugging Face Hub. يتم اختبار النموذج باستخدام llama-cli، ثم يتم تشغيل خادم استدلال محلي متوافق مع OpenAI. يتم توفير عميل Python للتفاعل مع الخادم، يدعم الإكمالات القياسية، والتدفق، والمحادثات متعددة الأدوار، وتوليد الأكواد. تشمل الخيارات الاختيارية استدلالًا بسياق طويل، وتخزين مؤقت لـ KV بدقة 4 بت، وفك تشفير تخميني باستخدام نموذج DSpark، ودعم الرؤية. يذكر البرنامج التعليمي أيضًا توفر نسخة ثلاثية الحالات لجودة أعلى.
المصدر: MarkTechPost —
الأصلي
