الأجهزة والاستدلال 🇷🇺 27.07.2026 09:02

استدلال نماذج اللغة الكبيرة: من ذاكرة التخزين المؤقت KV إلى النشر الإنتاجي

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
مهندس MLOps ذو خبرة من hh.ru يشرح كيفية تشغيل نماذج اللغة الكبيرة بكفاءة على أجهزتك الخاصة في عام 2026. تغطي المقالة الجوانب التقنية الرئيسية: ذاكرة التخزين المؤقت KV، محركات الاستدلال vLLM وSGLang، تطور آليات الانتباه، وتوصيات عملية لاختيار النموذج والتوازي والأجهزة للإنتاج.
Саша Рыжов, مهندس MLOps في hh.ru، يشارك خبرته في نشر نماذج اللغة الكبيرة (LLMs) على أجهزته الخاصة. يوضح أن كفاءة الاستدلال تعتمد بشكل أساسي على إدارة ذاكرة بطاقة الرسوميات، وليس على النموذج نفسه. يتم تحليل ذاكرة التخزين المؤقت KV بالتفصيل، والتي تحول مرحلة فك التشفير (decode) من كونها مقيدة بالحسابات إلى مقيدة بالذاكرة. يتم استعراض إطارين رئيسيين للاستدلال: vLLM مع آلية PagedAttention التي تحل مشكلات التجزئة الداخلية والخارجية (internal and external fragmentation)، وSGLang مع RadixAttention التي تنفذ تخزينًا مؤقتًا أكثر مرونة للبادئات. كما تم وصف الإمكانيات الإضافية لـ SGLang مثل Compressed FSM لاستدعاء الدوال (function calling)، وجدولة مراعية لذاكرة التخزين المؤقت (cache-aware scheduling)، وانتباه موازاة البيانات (dp-attention). تم ذكر تطور آليات الانتباه: من MHA عبر GQA وMLA إلى DSA - كل خطوة تالية تقلل حجم ذاكرة التخزين المؤقت KV. تم تقديم توصيات عملية: لبطاقة H100 وما أحدث، اختر SGLang؛ للبطاقات الأقدم، اختر vLLM. الحجم الأمثل للنموذج هو MoE حتى 120B أو Dense حتى 32B. للحصول على زمن انتقال منخفض، استخدم Tensor Parallelism؛ للإنتاجية العالية، استخدم Data Parallelism. يفصل prefill و decode يعطي أقصى إنتاجية ولكنه يتطلب موارد هندسية أكبر. لا يُوصى بفك التشفير التخميني (speculative decoding) للأنظمة عالية الحمل لأنه يستهلك ذاكرة إضافية لنموذج المسودة (draft model) ويقلل الإنتاجية الكلية.
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة