Inférence des LLM : du cache KV au déploiement en production
Un ingénieur MLOps expérimenté de hh.ru explique comment exécuter efficacement des grands modèles de langage sur votre propre matériel en 2026. L'article aborde les aspects techniques clés : cache KV, moteurs d'inférence vLLM et SGLang, évolution des mécanismes d'attention, et recommandations pratiques pour la sélection des modèles, le parallélisme et le matériel pour la production.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02
