Inferencia de LLM: Desde el KV-Cache hasta el despliegue en producción
Un ingeniero MLOps experimentado de hh.ru explica cómo ejecutar de manera eficiente modelos de lenguaje grandes en su propio hardware en 2026. El artículo cubre aspectos técnicos clave: KV-cache, motores de inferencia vLLM y SGLang, la evolución de los mecanismos de atención y recomendaciones prácticas para la selección de modelos, paralelismo y hardware para producción.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02
