MoE RTX 5090 -suorittimessa jää 1,5-kertaisesti jälkeen, eikä se johdu reitityksestä
Yksityiskohtainen suorituskykytesti RTX 5090 -näytönohjaimella paljastaa, että Mixture-of-Experts-malli (Qwen3.5-35B-A3B) käyttää vain 41 prosenttia GPU:n muistikaistanleveydestä, kun taas tiheä malli (Qwen3.5-9B) saavuttaa 72 prosenttia. Perimmäinen syy on riittämätön tavumäärä ytimen käynnistystä kohden, ei asiantuntijoiden reititys. Kirjoittaja ennustaa suurella tarkkuudella toisen mallin suorituskyvyn ja suorituskyvyn eri kontekstisyvyyksillä.
Kirjoittaja vertailee RTX 5090 -näytönohjainta käyttäen llama.cpp b10326 -versiota Q4_0-kvantisoinnilla. MoE-malli Qwen3.5-35B-A3B saavuttaa 317,45 tokenia sekunnissa, käyttäen vain 41 prosenttia muistin kaistanleveydestä, kun taas tiheä malli Qwen3.5-9B saavuttaa 239,62 tokenia sekunnissa, käyttäen 72 prosenttia. He sulkevat pois CUDA-kaaviot, reitityksen ja GPU:n vajaakäytön. Sen sijaan he osoittavat synteettisen ggml-ytimen avulla, että muistin kaistanleveys skaalautuu ytimen lukemien tavujen mukaan: pienet luvut (muutama megatavu) saavuttavat vain 20-50 prosenttia huippukaistanleveydestä. MoE-mallin monet asiantuntijaprojektiot johtavat moniin pieniin ytimiin (keskimäärin 4,6 megatavua per ydin), jotka jäävät alle täyden kaistanleveyden kynnyksen. Tiheä malli lukee suurempia matriiseja (22,2 megatavua per ydin), saavuttaen 86 prosenttia huipusta. Kirjoittaja ennustaa tiheän mallin nopeuden 3,7 prosentin tarkkuudella ja kontekstin syvyyden skaalautumisen 2,4 prosentin tarkkuudella, mikä vahvistaa heidän mallinsa. He huomauttavat myös alustavasta skaalauslaista: 90 prosentin kaistanleveyden kynnys skaalautuu GPU:n leveyden mukaan (8-kertainen RTX 4060:sta 5090:een).
Lähde: Habr — хаб ИИ —
Alkuperäinen
