Inferência de LLM: Do Cache KV à Implantação em Produção
Um engenheiro de MLOps da hh.ru explica os fundamentos da inferência de LLM em hardware local. O artigo aborda o cache KV, os motores de inferência vLLM e SGLang, a evolução dos mecanismos de atenção (MHA, GQA, MLA, DSA) e recomendações práticas para escolha de hardware e esquemas de paralelismo.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02



