Hardware e Inferencia 🇷🇺 27.07.2026 09:02

Inferencia de LLM: Desde KV-Cache hasta el Despliegue en Producción

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Un ingeniero de MLOps de hh.ru explica los fundamentos de la inferencia de LLM en hardware local. El artículo cubre KV-cache, los motores de inferencia vLLM y SGLang, la evolución de los mecanismos de atención (MHA, GQA, MLA, DSA) y recomendaciones prácticas para elegir hardware y esquemas de paralelismo.
El artículo del ingeniero MLOps Alexander Ryzhov, de hh.ru, analiza los desafíos y soluciones para implementar modelos de lenguaje grandes (LLM) en servidores propios. La idea clave es que la eficiencia de la inferencia está dominada por la gestión de la memoria de la GPU. La caché KV transforma la etapa de decodificación de un límite computacional a un límite de ancho de banda de memoria. El autor explica la evolución de los mecanismos de atención: MHA (2017), GQA (2023), MLA (2024) de DeepSeek y DSA (2025) en DeepSeek v3.2, cada uno reduce el tamaño de la caché KV. Los motores de inferencia vLLM (código abierto) utiliza PagedAttention para reducir la fragmentación de memoria, mientras que SGLang (código abierto) utiliza RadixAttention para un almacenamiento en caché de prefijos más flexible. En cuanto al hardware, se recomienda SGLang para H100 y superiores, y vLLM para Ampere y anteriores. El punto óptimo para un nodo (8x H100, 640 GB de VRAM) son modelos MoE de hasta ~120B o modelos densos de hasta ~32B. El paralelismo tensorial (TP) reduce la latencia, el paralelismo de datos (DP) maximiza el rendimiento. La desagregación de prellenado y decodificación ofrece el mayor rendimiento, pero requiere más ingeniería. La decodificación especulativa no es una panacea, ya que se degrada bajo alta concurrencia. El artículo concluye con una lista de verificación para la implementación en producción.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas