LLM推理:从KV缓存到生产部署
hh.ru的MLOps工程师解释了在本地硬件上进行LLM推理的基础知识。文章涵盖KV缓存、推理引擎vLLM和SGLang、注意力机制演进(MHA、GQA、MLA、DSA),以及选择硬件和并行策略的实用建议。
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
Habr — хаб ИИ27.07 · 09:02
hh.ru的MLOps工程师解释了在本地硬件上进行LLM推理的基础知识。文章涵盖KV缓存、推理引擎vLLM和SGLang、注意力机制演进(MHA、GQA、MLA、DSA),以及选择硬件和并行策略的实用建议。
vLLM
SGLang
Meta
DeepSeek
Alibaba/Qwen
Moonshot AI
埃隆·马斯克表示,在两到三年内,太空数据中心将比地面数据中心更便宜。然而,专家指出了严重的技术和经济挑战:在真空中冷却图形处理器、巨大的散热器以及部署一百万颗卫星的不切实际的时间表。
SpaceX
NVIDIA
xAI