FasterTransformer

أحدث أخبار ونماذج وإصدارات الذكاء الاصطناعي من FasterTransformer.

تدهور استدلال نماذج اللغة الكبيرة في الإنتاج: ذاكرة التخزين المؤقت KV، نفاد الذاكرة، والذيل p99

غالبًا ما يتدهور استدلال نماذج اللغة الكبيرة في الإنتاج تدريجيًا بسبب تجزئة ذاكرة التخزين المؤقت (KV-cache)، نفاد الذاكرة في السياقات الطويلة، حجب قائمة الانتظار، وارتفاع زمن الاستجابة في الذيل. يشرح المبشر التقني في VK Cloud، ستاس بوغورزيلسكي، أربع آليات تسبب تدهور الأداء، ويقدم نصوصًا لإعادة الإنتاج ومقاييس لاكتشاف المشكلات قبل وقوع الحوادث.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
أخبار جديدة