Inférence LLM : du cache KV au déploiement en production
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Un ingénieur MLOps de hh.ru explique les fondamentaux de l'inférence de grands modèles de langage (LLM) sur du matériel sur site. L'article couvre le cache KV, les moteurs d'inférence vLLM et SGLang, l'évolution des mécanismes d'attention (MHA, GQA, MLA, DSA), ainsi que des recommandations pratiques pour choisir le matériel et les schémas de parallélisme.
L'article d'Alexandre Ryzhov, ingénieur MLOps chez hh.ru, aborde les défis et solutions liés au déploiement de grands modèles de langage (Large Language Models, LLMs) sur ses propres serveurs. L'idée clé est que l'efficacité de l'inférence est dominée par la gestion de la mémoire GPU. Le cache KV (Key-Value) fait passer l'étape de décodage d'une limite de calcul à une limite de bande passante mémoire. L'auteur explique l'évolution des mécanismes d'attention : MHA (2017), GQA (2023), MLA (2024) de DeepSeek, et DSA (2025) dans DeepSeek v3.2, chacun réduisant la taille du cache KV. Les moteurs d'inférence vLLM (open-source) utilise PagedAttention pour réduire la fragmentation mémoire, tandis que SGLang (open-source) emploie RadixAttention pour un cache de préfixes plus flexible. Côté matériel, SGLang est recommandé pour les H100 et au-delà, vLLM pour les architectures Ampere et antérieures. Le point optimal pour un nœud unique (8x H100, 640 Go de VRAM) concerne les modèles MoE jusqu'à environ 120 milliards de paramètres ou les modèles denses jusqu'à environ 32 milliards de paramètres. Le parallélisme tensoriel (Tensor Parallelism, TP) réduit la latence, tandis que le parallélisme de données (Data Parallelism, DP) maximise le débit. La désagrégation préremplissage/décodage offre le débit le plus élevé mais nécessite davantage d'ingénierie. Le décodage spéculatif n'est pas une panacée car il se dégrade sous forte concurrence. L'article se conclut par une liste de vérification pour un déploiement en production.
Source: Habr — хаб ИИ —
original
