Hardware e Inferência 🇷🇺 27.07.2026 09:02

Inferência de LLM: Do Cache KV à Implantação em Produção

vLLMvLLM SGLangSGLang MetaMeta DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen Moonshot AIMoonshot AI
Um engenheiro de MLOps da hh.ru explica os fundamentos da inferência de LLM em hardware local. O artigo aborda o cache KV, os motores de inferência vLLM e SGLang, a evolução dos mecanismos de atenção (MHA, GQA, MLA, DSA) e recomendações práticas para escolha de hardware e esquemas de paralelismo.
O artigo do engenheiro de MLOps Alexander Ryzhov, do hh.ru, discute os desafios e soluções para implantar modelos de linguagem de grande porte (LLMs) em servidores próprios. A principal conclusão é que a eficiência da inferência é dominada pelo gerenciamento de memória da GPU. O cache de valores-chave (KV-cache) desloca o estágio de decodificação de limitado por computação para limitado por largura de banda de memória. O autor explica a evolução dos mecanismos de atenção: MHA (2017), GQA (2023), MLA (2024) da DeepSeek e DSA (2025) no DeepSeek v3.2, cada um reduzindo o tamanho do KV-cache. Os mecanismos de inferência vLLM (código aberto) usam PagedAttention para reduzir a fragmentação de memória, enquanto o SGLang (código aberto) usa RadixAttention para um cache de prefixo mais flexível. Para hardware, o SGLang é recomendado para H100 e superiores, e o vLLM para Ampere e anteriores. O ponto ideal para um nó (8x H100, 640 GB de VRAM) são modelos MoE de até ~120B ou modelos densos de até ~32B. O Paralelismo de Tensor (TP) reduz a latência, enquanto o Paralelismo de Dados (DP) maximiza a taxa de transferência. A desagregação Prefill/Decode oferece a maior taxa de transferência, mas requer mais engenharia. A decodificação especulativa não é uma panaceia, pois degrada sob alta concorrência. O artigo conclui com uma lista de verificação para implantação em produção.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas