硬件与推理研究 🇷🇺 12.08.2026 12:01

RTX 5090上MoE性能不足1.5倍,问题不在路由

在RTX 5090上的详细基准测试显示,混合专家模型(Qwen3.5-35B-A3B)仅利用了GPU内存带宽的41%,而密集模型(Qwen3.5-9B)则达到了72%。根本原因在于每次内核启动时读取的字节数不足,而非专家路由问题。作者对另一模型及不同上下文深度下的性能进行了高精度预测。
作者使用llama.cpp b10326和Q4_0量化对RTX 5090进行了基准测试。MoE模型Qwen3.5-35B-A3B实现了317.45 tokens/s,仅利用了41%的内存带宽,而密集模型Qwen3.5-9B实现了239.62 tokens/s,利用了72%的带宽。他们排除了CUDA图形、路由和GPU利用率不足的原因。相反,他们通过一个合成的ggml内核证明,内存带宽随每个内核读取的字节数而变化:小读取(几MB)只能达到峰值带宽的20-50%。MoE模型的许多专家投影导致了许多小内核(平均每个内核4.6 MB),低于完全带宽的阈值。密集模型读取更大的矩阵(每个内核22.2 MB),达到了峰值带宽的86%。作者预测密集模型的速度误差在3.7%以内,上下文深度缩放误差在2.4%以内,验证了他们的模型。他们还指出一个初步的缩放规律:90%带宽的阈值随GPU宽度缩放(从RTX 4060到5090为8倍)。
来源: Habr — хаб ИИ — 原文
我们之前关于此话题的帖子 ↓
最新新闻