DeepSeek 0731 在 DGX Spark 上:超频至 68 tok/s 及为什么作者在模型卡上标注 57
DeepSeek
NVIDIA
vLLM
一位开发者在双 NVIDIA DGX Spark 配置下对 DeepSeek-V4-Flash 进行基准测试,初始测得 42.5 tok/s,而模型卡声称达到 57 tok/s。在更换 vLLM 运行时镜像并明确启用 B12X 混合专家(MoE)后端后,他们在卡片式配置下实现了 67.6 tok/s,并将改进归因于特定的配置更改。
作者在两台通过 QSFP 200G 与 RoCEv2 连接的 DGX Spark 节点上部署了 DeepSeek-V4-Flash,并使用跨节点的张量并行。初步测量显示吞吐量为 42.5 tok/s,比模型卡上声称的 57 tok/s 低约 25%。在测试了几个假设(温度、前缀填充计算、上下文长度)之后,主要差异归因于运行时镜像:从基于 vLLM 0.21.1 的构建切换到基于 vLLM 0.25.2 的构建,在相同检查点上获得了 +22% 的提升,每个验证步骤的输出令牌数从 3.27 增加到 4.80。进一步的提升来自显式设置 --moe-backend flashinfer_b12x,因为在自定义镜像中,B12X 被排除在自动选择之外;这在类似卡片的配置文件上平均增加了 +13.3%(从 59.7 到 67.6 tok/s)。作者还提到了新检查点版本(0731)的发布,该版本改进了智能体基准测试,并感谢 tonyd2wild 在类似优化方面的并行工作。
来源: Habr — хаб ИИ —
原文
