Matériel et Inférence 🇷🇺 05.08.2026 04:04

Dégradation de l'inférence des LLM en production : cache KV, OOM et latence p99

vLLMvLLM MetaMeta NVIDIANVIDIA Hugging FaceHugging Face AnyscaleAnyscale Ray ServeRay Serve Text Generation Inference (TGI)Text Generation Inference (TGI) FasterTransformerFasterTransformer
L'inférence des LLM en production se dégrade souvent progressivement en raison de la fragmentation du cache KV, des dépassements de mémoire (OOM) sur les contextes longs, du blocage de tête de file et des pics de latence p99. L'évangéliste de VK Cloud, Stas Pogorzhelsky, explique quatre mécanismes à l'origine de la dégradation des performances et propose des scripts de reproduction et des métriques pour détecter les problèmes avant les incidents.
L'évangéliste technologique de VK Cloud, Stas Pogorzhelsky, explique que l'inférence de LLM en production se dégrade généralement progressivement plutôt que d'échouer immédiatement. Il identifie quatre mécanismes clés : la fragmentation du cache KV entraînant une perte de mémoire de 60 à 80 %, les dépassements de mémoire sur les contextes longs, le blocage de tête de file dans les lots, et la divergence des métriques p50/p99. L'article fournit des scripts de reproduction et des métriques pour détecter les problèmes avant les incidents. Il souligne que le cache KV dépasse souvent le poids des modèles en production. PagedAttention réduit la fragmentation à moins de 4 % et augmente le débit de 2 à 4 fois, mais la fragmentation externe et l'éviction posent toujours des problèmes au fil du temps. Le batching continu peut provoquer un blocage de tête de file lorsqu'une requête de préremplissage longue retarde les requêtes plus courtes ; le préremplissage en morceaux atténue ce problème. La quantification FP8 du cache KV double presque la capacité mémoire effective par rapport au FP16. Il est conseillé de surveiller les tendances de l'utilisation du cache et du pic de KV plutôt que d'attendre un dépassement de mémoire.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches