Inferência de LLMs: Do KV-Cache à Implantação em Produção
Um engenheiro de MLOps experiente do hh.ru explica como executar grandes modelos de linguagem de forma eficiente em seu próprio hardware em 2026. O artigo aborda aspectos técnicos essenciais: KV-cache, mecanismos de inferência vLLM e SGLang, a evolução dos mecanismos de atenção e recomendações práticas para seleção de modelos, paralelismo e hardware para produção.
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02
