RTX 5090에서 MoE 성능 1.5배 뒤처짐, 라우팅 문제 아냐
RTX 5090에서의 상세한 벤치마크에 따르면, Mixture-of-Experts(MoE) 모델(Qwen3.5-35B-A3B)은 GPU 메모리 대역폭의 41%만 활용하는 반면, 밀집 모델(Qwen3.5-9B)은 72%를 활용합니다. 근본 원인은 전문가 라우팅이 아니라 커널 실행당 읽는 바이트 수가 부족하기 때문입니다. 저자는 다른 모델과 컨텍스트 깊이에 따른 성능을 높은 정확도로 예측합니다.
저자는 llama.cpp b10326과 Q4_0 양자화를 사용하여 RTX 5090을 벤치마킹했습니다. MoE 모델인 Qwen3.5-35B-A3B는 317.45 tokens/s를 달성했으며, 메모리 대역폭의 41%만 사용한 반면, 덴스 모델인 Qwen3.5-9B는 239.62 tokens/s를 달성했고 72%를 사용했습니다. 그들은 CUDA 그래프, 라우팅, GPU 활용도 저하를 원인으로 배제했습니다. 대신, 합성 ggml 커널을 통해 메모리 대역폭이 커널당 읽는 바이트 수에 따라 확장됨을 입증했습니다: 작은 읽기(수 MB)는 피크 대역폭의 20-50%만 달성합니다. MoE 모델의 많은 전문가 프로젝션은 많은 작은 커널(커널당 평균 4.6 MB)을 생성하여 전체 대역폭에 도달하지 못합니다. 덴스 모델은 더 큰 행렬(커널당 22.2 MB)을 읽어 피크의 86%를 달성합니다. 저자는 덴스 모델의 속도를 3.7% 이내, 컨텍스트 깊이 스케일링을 2.4% 이내로 예측하여 모델을 검증했습니다. 또한 잠정적인 스케일링 법칙을 언급합니다: 90% 대역폭에 대한 임계값은 GPU 너비에 따라 확장됩니다(RTX 4060에서 5090으로 8배).
출처: Habr — хаб ИИ —
원문
