الأجهزة والاستدلال 🇷🇺 05.08.2026 04:04

تدهور استدلال نماذج اللغة الكبيرة في الإنتاج: ذاكرة التخزين المؤقت KV، نفاد الذاكرة، والذيل p99

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
غالبًا ما يتدهور استدلال نماذج اللغة الكبيرة في الإنتاج تدريجيًا بسبب تجزئة ذاكرة التخزين المؤقت (KV-cache)، نفاد الذاكرة في السياقات الطويلة، حجب قائمة الانتظار، وارتفاع زمن الاستجابة في الذيل. يشرح المبشر التقني في VK Cloud، ستاس بوغورزيلسكي، أربع آليات تسبب تدهور الأداء، ويقدم نصوصًا لإعادة الإنتاج ومقاييس لاكتشاف المشكلات قبل وقوع الحوادث.
خبير التكنولوجيا في VK Cloud ستاس بوغورزيلسكي يشرح أن استدلال نماذج اللغة الكبيرة في بيئة الإنتاج عادةً ما يتدهور تدريجياً بدلاً من الفشل الفوري. ويحدد أربع آليات رئيسية: تجزئة ذاكرة التخزين المؤقت للقيم الرئيسية (KV-cache) مما يسبب فقدان 60-80% من الذاكرة، ونفاد الذاكرة (OOM) عند السياقات الطويلة، وحجب الرأس في الطابور (head-of-line blocking) في الدفعات، وتباعد مقاييس p50/p99. يقدم المقال سكريبتات لإعادة الإنتاج ومقاييس لاكتشاف المشكلات قبل وقوع الحوادث. ويشير إلى أن ذاكرة التخزين المؤقت للقيم الرئيسية غالباً ما تتجاوز أوزان النموذج في الإنتاج. تعمل تقنية PagedAttention على تقليل التجزئة إلى أقل من 4% وتزيد الإنتاجية بمقدار 2-4 مرات، لكن التجزئة الخارجية والإخلاء ما زالا يسببان مشكلات بمرور الوقت. يمكن أن يتسبب المعالجة المستمرة بالدفعات (continuous batching) في حجب الرأس في الطابور عندما تؤخر طلبات ما قبل التعبئة الطويلة الطلبات الأقصر؛ وتخفف معالجة التعبئة المجزأة (chunked prefill) من ذلك. يؤدي تكميم ذاكرة التخزين المؤقت للقيم الرئيسية بدقة FP8 إلى مضاعفة سعة الذاكرة الفعالة تقريباً مقارنةً بدقة FP16. يُنصح بمراقبة اتجاهات استخدام ذاكرة التخزين المؤقت وذروة القيم الرئيسية بدلاً من انتظار حدوث نفاد الذاكرة (OOM).
المصدر: Habr — хаб ИИ — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة