MoE en RTX 5090 se queda corto por 1.5x, y no se trata del enrutamiento
Un análisis comparativo detallado en una RTX 5090 revela que un modelo de Mezcla de Expertos (Qwen3.5-35B-A3B) utiliza solo el 41% del ancho de banda de memoria de la GPU, mientras que un modelo denso (Qwen3.5-9B) alcanza el 72%. La causa raíz es la insuficiencia de bytes leídos por lanzamiento de kernel, no el enrutamiento de expertos. El autor predice con alta precisión el rendimiento de otro modelo y en diferentes profundidades de contexto.
El autor realiza pruebas comparativas del RTX 5090 utilizando llama.cpp b10326 con cuantización Q4_0. El modelo MoE Qwen3.5-35B-A3B alcanza 317,45 tokens/s, utilizando solo el 41% del ancho de banda de memoria, mientras que el modelo denso Qwen3.5-9B alcanza 239,62 tokens/s, utilizando el 72%. Se descartan los gráficos CUDA, el enrutamiento y la subutilización de la GPU. En su lugar, se demuestra mediante un kernel ggml sintético que el ancho de banda de memoria escala con los bytes leídos por kernel: las lecturas pequeñas (unos pocos MB) solo alcanzan el 20-50% del ancho de banda máximo. Las numerosas proyecciones de expertos del modelo MoE resultan en muchos kernels pequeños (media de 4,6 MB por kernel), que quedan por debajo del umbral para el ancho de banda completo. El modelo denso lee matrices más grandes (22,2 MB por kernel), alcanzando el 86% del máximo. El autor predice la velocidad del modelo denso con un error del 3,7% y la escala de profundidad de contexto con un 2,4%, validando su modelo. También señalan una ley de escalado tentativa: el umbral para el 90% del ancho de banda escala con la anchura de la GPU (8x desde RTX 4060 hasta 5090).
Fuente: Habr — хаб ИИ —
original
