Hardware e InferênciaPesquisa 🇷🇺 12.08.2026 12:01

MoE no RTX 5090 fica 1,5x aquém, e não é sobre roteamento

Um benchmark detalhado em um RTX 5090 revela que um modelo Mixture-of-Experts (Qwen3.5-35B-A3B) utiliza apenas 41% da largura de banda de memória da GPU, enquanto um modelo denso (Qwen3.5-9B) atinge 72%. A causa raiz é a quantidade insuficiente de bytes lidos por lançamento de kernel, não o roteamento de especialistas. O autor prevê o desempenho para outro modelo e em diferentes profundidades de contexto com alta precisão.
O autor avalia a RTX 5090 usando llama.cpp b10326 com quantização Q4_0. O modelo MoE Qwen3.5-35B-A3B alcança 317,45 tokens/s, utilizando apenas 41% da largura de banda de memória, enquanto o modelo denso Qwen3.5-9B alcança 239,62 tokens/s, utilizando 72%. Eles descartam CUDA graphs, roteamento e subutilização da GPU. Em vez disso, demonstram por meio de um kernel ggml sintético que a largura de banda da memória escala com os bytes lidos por kernel: leituras pequenas (alguns MB) atingem apenas 20-50% da largura de banda máxima. O modelo MoE, com muitas projeções de especialistas, resulta em muitos kernels pequenos (média de 4,6 MB por kernel), ficando abaixo do limite para largura de banda completa. O modelo denso lê matrizes maiores (22,2 MB por kernel), atingindo 86% do pico. O autor prevê a velocidade do modelo denso com 3,7% de erro e a escala de profundidade de contexto com 2,4% de erro, validando seu modelo. Eles também notam uma lei de escala tentativa: o limite para 90% de largura de banda escala com a largura da GPU (8x da RTX 4060 para a 5090).
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas