Matériel et Inférence 🇷🇺 27.07.2026 09:02

Inférence des LLM : du cache KV au déploiement en production

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Un ingénieur MLOps expérimenté de hh.ru explique comment exécuter efficacement des grands modèles de langage sur votre propre matériel en 2026. L'article aborde les aspects techniques clés : cache KV, moteurs d'inférence vLLM et SGLang, évolution des mécanismes d'attention, et recommandations pratiques pour la sélection des modèles, le parallélisme et le matériel pour la production.
Sacha Ryzhov, ingénieur MLOps chez hh.ru, partage son expérience de déploiement de LLM sur du matériel dédié. Il explique que l'efficacité de l'inférence dépend avant tout de la gestion de la mémoire du GPU, et non du modèle lui-même. Il détaille le cache KV, qui transforme la phase de décodage de « compute-bound » en « memory-bound ». Deux frameworks d'inférence principaux sont examinés : vLLM avec le mécanisme PagedAttention, qui résout les problèmes de fragmentation interne et externe, et SGLang avec RadixAttention, qui implémente une mise en cache plus flexible des préfixes. Sont également décrites les fonctionnalités supplémentaires de SGLang, comme le Compressed FSM pour le « function calling », le « cache-aware scheduling » et l'attention DP. L'évolution des mécanismes d'attention est mentionnée : de MHA à GQA en passant par MLA, jusqu'à DSA — chaque étape suivante réduit la taille du cache KV. Des recommandations pratiques sont données : pour les H100 et plus récents, choisir SGLang ; pour les cartes plus anciennes, vLLM ; la taille optimale du modèle est MoE jusqu'à 120 milliards ou Dense jusqu'à 32 milliards ; pour une faible latence, utiliser le parallélisme tensoriel ; pour un débit élevé, le parallélisme des données ; la séparation du « prefill » et du décodage offre le débit maximal, mais nécessite davantage de ressources d'ingénierie. Le décodage spéculatif n'est pas recommandé pour les systèmes à forte charge, car il consomme de la mémoire supplémentaire pour le modèle « draft » et réduit le débit global.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches