FasterTransformer

Dernières actualités, modèles et sorties d'IA de FasterTransformer.

Dégradation de l'inférence des LLM en production : cache KV, OOM et latence p99

L'inférence des LLM en production se dégrade souvent progressivement en raison de la fragmentation du cache KV, des dépassements de mémoire (OOM) sur les contextes longs, du blocage de tête de file et des pics de latence p99. L'évangéliste de VK Cloud, Stas Pogorzhelsky, explique quatre mécanismes à l'origine de la dégradation des performances et propose des scripts de reproduction et des métriques pour détecter les problèmes avant les incidents.

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
Habr — хаб ИИ05.08 · 04:04
Infos fraîches