硬件与推理开源 🇷🇺 24.07.2026 10:04

Strix Halo 平台迷你 PC 并行负载测试:32 个并发请求下 236 tok/s,出现三个错误

Google/DeepMindGoogle/DeepMind
一款搭载 Ryzen AI Max+ 395 的 Beelink GTR9 Pro 在短时间运行中,以 32 个并发请求实现了 236 tok/s 的聚合速率,并在 30 分钟内维持平均 226 tok/s 且无降频。作者发现所有测试模型在 8 至 10 个并发客户端之间存在一个可复现的吞吐量下降,同时,推测解码(MTP)能将单客户端性能提升 42%,但在并发场景下反而成为负担。
测试一台 Beelink GTR9 Pro(Ryzen AI Max+ 395、Radeon 8060S、128 GB 统一内存),作者使用 llama.cpp 通过 Vulkan/RADV 进行了并行推理基准测试。Qwen 3.6 35B-A3B 在 Q4_K_M 量化下呈现出吞吐量低谷:在 8 个客户端时为 149 tok/s,下降到 10 个客户端时的 99 tok/s,然后在 32 个客户端时恢复至 160 tok/s。该低谷在所有测试模型(三个量化版本的 Qwen 和 QAT 量化的 Gemma 4 26B)中均可重现,且不能归因于单一模型或量化方式。最佳聚合吞吐量为 236 tok/s,来自 Gemma 4 在 32 个客户端时的表现(75 秒运行的中位数)。一次 30 分钟的耐力测试平均吞吐量为 226.4 tok/s,温度(78°C)和功耗(113 W)稳定,因服务器计时缺失导致 1.4% 的错误。推测解码(多令牌预测)将单客户端速度提升了 42%(从 53.3 tok/s 到 75.6 tok/s),但损害了并发性能:在 4 个客户端时吞吐量下降 31%,在 32 个客户端时吞吐量损失 33%。作者指出,在发布前通过控制测量发现了三个错误。
来源: Habr — хаб NLP — 原文
我们之前关于此话题的帖子 ↓
最新新闻