MoE sur RTX 5090 : 1,5 fois sous les attentes, et ce n'est pas une question de routage
Un benchmark détaillé sur une RTX 5090 révèle qu'un modèle de mélange d'experts (Qwen3.5-35B-A3B) n'utilise que 41 % de la bande passante mémoire du GPU, tandis qu'un modèle dense (Qwen3.5-9B) atteint 72 %. La cause principale est un nombre insuffisant d'octets lus par lancement de noyau, et non le routage des experts. L'auteur prédit avec une grande précision les performances d'un autre modèle et sur différentes profondeurs de contexte.
L'auteur évalue le RTX 5090 avec llama.cpp b10326 en utilisant la quantification Q4_0. Le modèle MoE Qwen3.5-35B-A3B atteint 317,45 tokens/s, n'utilisant que 41 % de la bande passante mémoire, tandis que le modèle dense Qwen3.5-9B atteint 239,62 tokens/s, utilisant 72 %. Ils écartent les graphes CUDA, le routage et la sous-utilisation du GPU. Au lieu de cela, ils démontrent via un noyau ggml synthétique que la bande passante mémoire évolue avec les octets lus par noyau : les petites lectures (quelques Mo) n'atteignent que 20 à 50 % de la bande passante maximale. Les nombreuses projections d'experts du modèle MoE entraînent de nombreux petits noyaux (en moyenne 4,6 Mo par noyau), ce qui reste en dessous du seuil pour une bande passante complète. Le modèle dense lit des matrices plus grandes (22,2 Mo par noyau), atteignant 86 % du maximum. L'auteur prédit la vitesse du modèle dense à 3,7 % près et l'échelle de la profondeur de contexte à 2,4 % près, validant ainsi leur modèle. Ils notent également une loi d'échelle provisoire : le seuil pour 90 % de la bande passante évolue avec la largeur du GPU (8 fois du RTX 4060 au 5090).
Source: Habr — хаб ИИ —
original
