Perangkat Keras & InferensiRiset 🇷🇺 12.08.2026 12:01

MoE di RTX 5090 Tertinggal 1,5 Kali Lipat, dan Bukan Soal Routing

Benchmark terperinci pada RTX 5090 mengungkap bahwa model Mixture-of-Experts (Qwen3.5-35B-A3B) hanya memanfaatkan 41% dari bandwidth memori GPU, sementara model padat (Qwen3.5-9B) mencapai 72%. Akar masalahnya adalah byte yang dibaca per peluncuran kernel tidak mencukupi, bukan routing pakar. Penulis memprediksi performa untuk model lain dan di berbagai kedalaman konteks dengan akurasi tinggi.
Penulis melakukan benchmarking RTX 5090 menggunakan llama.cpp b10326 dengan kuantisasi Q4_0. Model MoE Qwen3.5-35B-A3B mencapai 317,45 token/detik, hanya memanfaatkan 41% dari bandwidth memori, sementara model padat Qwen3.5-9B mencapai 239,62 token/detik, memanfaatkan 72%. Mereka mengesampingkan CUDA graphs, routing, dan pemanfaatan GPU yang kurang. Sebagai gantinya, mereka menunjukkan melalui kernel ggml sintetis bahwa bandwidth memori berskala dengan jumlah byte yang dibaca per kernel: pembacaan kecil (beberapa MB) hanya mencapai 20-50% dari bandwidth puncak. Model MoE dengan banyak proyeksi ahli menghasilkan banyak kernel kecil (rata-rata 4,6 MB per kernel), berada di bawah ambang batas untuk bandwidth penuh. Model padat membaca matriks yang lebih besar (22,2 MB per kernel), mencapai 86% dari puncak. Penulis memprediksi kecepatan model padat dalam 3,7% dan penskalaan kedalaman konteks dalam 2,4%, memvalidasi model mereka. Mereka juga mencatat hukum skala tentatif: ambang batas untuk bandwidth 90% berskala dengan lebar GPU (8x dari RTX 4060 ke 5090).
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru