硬件与推理 🇷🇺 04.08.2026 11:03

在旧笔记本电脑集群上推理大语言模型

MetaMeta Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
一项实验使用llama.cpp的远程过程调用协议,在三台旧笔记本电脑上测试了分布式大语言模型推理。结果表明,当模型无法容纳在单个节点的内存中时,分布式推理才能带来显著的加速;对于较小的模型,网络开销使得单个快速节点反而更快。测试还发现,提示词处理受益于并行化,而令牌生成则不然。
进行了一项实验,旨在测试在三台配备不同代际 Intel CPU 的旧笔记本电脑集群上的分布式 LLM 推理性能:Core i7-4700MQ(Haswell,2013)、Core i5-8265U(Whiskey Lake,2018)和 Core i3-1115G4(Tiger Lake,2020),总内存为 52 GB。使用的软件是 llama.cpp(构建版本 b10069),每个节点上运行 RPC 服务器,节点之间通过千兆以太网连接。测试的模型包括 Llama-3.2-1B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-32B-Instruct(均为 Q4_K_M 量化)以及 gpt-oss-20b(MoE 架构)。对于 1B 模型,集群(i3+i5)的令牌生成速度为 22.5 令牌/秒,而最佳单节点(i3)为 29.2 令牌/秒,性能下降了 23%。对于 8B 模型,集群性能几乎与单节点持平(4.6 对 4.9 令牌/秒),但提示处理速度几乎快了 3 倍(10.9 对 3.9 令牌/秒)。对于 32B 模型,该模型无法在任何单个节点上容纳,集群实现了 1.1 令牌/秒的速度,而单节点在交换内存的情况下仅为 0.3 令牌/秒,性能提升了 268%。对于同样无法在单节点上容纳的 MoE 模型 gpt-oss-20b,集群提供了稳定的 8.0-8.1 令牌/秒的生成速度和 15.4-15.9 令牌/秒的提示评估速度,而单节点性能则不稳定。结论是,仅当模型无法容纳在单个节点中时,分布式推理才是合理的;否则,单个快速节点更为优越。此外,提示处理受益于并行性,而令牌生成则不然,且任何薄弱节点都可能成为集群的瓶颈。
来源: Habr — хаб ML — 原文
我们之前关于此话题的帖子 ↓
最新新闻