MoE на RTX 5090 уступает в 1,5 раза, и дело не в маршрутизации
Детальный бенчмарк на RTX 5090 показывает, что модель на основе смеси экспертов (Qwen3.5-35B-A3B) использует лишь 41% пропускной способности памяти GPU, в то время как плотная модель (Qwen3.5-9B) достигает 72%. Корневая причина — недостаточное количество байт, считываемых за один запуск ядра, а не маршрутизация экспертов. Автор с высокой точностью прогнозирует производительность другой модели и в зависимости от глубины контекста.
Автор проводит бенчмарк RTX 5090 с использованием llama.cpp b10326 и квантованием Q4_0. Модель MoE Qwen3.5-35B-A3B достигает 317,45 токенов/с, используя лишь 41% пропускной способности памяти, в то время как плотная модель Qwen3.5-9B достигает 239,62 токенов/с, используя 72%. Они исключают CUDA-графы, маршрутизацию и недоиспользование GPU. Вместо этого они демонстрируют с помощью синтетического
Показать ещё ↓
Источник: Habr — хаб ИИ —
оригинал
