Text Generation Inference (TGI)

नवीनतम AI समाचार, मॉडल और रिलीज़ Text Generation Inference (TGI).

प्रोडक्शन में LLM इन्फरेंस डिग्रेडेशन: KV-कैश, OOM, और p99 टेल

प्रोडक्शन में LLM इन्फरेंस अक्सर धीरे-धीरे खराब होता है, जो KV-कैश फ्रैग्मेंटेशन, लंबे संदर्भों में OOM, हेड-ऑफ-लाइन ब्लॉकिंग, और p99 लेटेंसी स्पाइक्स के कारण होता है। VK क्लाउड के इवेंजेलिस्ट Stas Pogorzhelsky चार ऐसे तंत्रों की व्याख्या करते हैं जो प्रदर्शन में गिरावट लाते हैं, और समस्याओं को घटित होने से पहले पकड़ने के लिए रिप्रोडक्शन स्क्रिप्ट्स और मेट्रिक्स प्रदान करते हैं।

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
ताज़ा समाचार