FasterTransformer

नवीनतम AI समाचार, मॉडल और रिलीज़ FasterTransformer.

प्रोडक्शन में LLM इन्फरेंस डिग्रेडेशन: KV-कैश, OOM, और p99 टेल

प्रोडक्शन में LLM इन्फरेंस अक्सर धीरे-धीरे खराब होता है, जो KV-कैश फ्रैग्मेंटेशन, लंबे संदर्भों में OOM, हेड-ऑफ-लाइन ब्लॉकिंग, और p99 लेटेंसी स्पाइक्स के कारण होता है। VK क्लाउड के इवेंजेलिस्ट Stas Pogorzhelsky चार ऐसे तंत्रों की व्याख्या करते हैं जो प्रदर्शन में गिरावट लाते हैं, और समस्याओं को घटित होने से पहले पकड़ने के लिए रिप्रोडक्शन स्क्रिप्ट्स और मेट्रिक्स प्रदान करते हैं।

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
ताज़ा समाचार