Inferencia de LLM: Desde KV-Cache hasta el Despliegue en Producción
Un ingeniero de MLOps de hh.ru explica los fundamentos de la inferencia de LLM en hardware local. El artículo cubre KV-cache, los motores de inferencia vLLM y SGLang, la evolución de los mecanismos de atención (MHA, GQA, MLA, DSA) y recomendaciones prácticas para elegir hardware y esquemas de paralelismo.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02



