Phần cứng & Suy luậnNghiên cứu 🇷🇺 12.08.2026 12:01

MoE trên RTX 5090 kém 1,5 lần, và vấn đề không nằm ở định tuyến

Một bài đánh giá chi tiết trên RTX 5090 tiết lộ rằng mô hình Mixture-of-Experts (Qwen3.5-35B-A3B) chỉ sử dụng 41% băng thông bộ nhớ của GPU, trong khi mô hình dày đặc (Qwen3.5-9B) đạt được 72%. Nguyên nhân gốc rễ là số byte đọc mỗi lần khởi động kernel không đủ, không phải do định tuyến chuyên gia. Tác giả dự đoán hiệu suất cho một mô hình khác và qua các độ sâu ngữ cảnh với độ chính xác cao.
Tác giả benchmark RTX 5090 bằng llama.cpp b10326 với quantization Q4_0. Mô hình MoE Qwen3.5-35B-A3B đạt 317,45 tokens/s, chỉ sử dụng 41% băng thông bộ nhớ, trong khi mô hình dense Qwen3.5-9B đạt 239,62 tokens/s, sử dụng 72%. Họ loại trừ CUDA graphs, routing và GPU không được tận dụng hết. Thay vào đó, họ chứng minh qua một kernel ggml tổng hợp rằng băng thông bộ nhớ tỷ lệ với số byte đọc trên mỗi kernel: với lượng đọc nhỏ (vài MB) chỉ đạt 20-50% băng thông đỉnh. Mô hình MoE có nhiều phép chiếu chuyên gia dẫn đến nhiều kernel nhỏ (trung bình 4,6 MB mỗi kernel), nằm dưới ngưỡng để đạt băng thông tối đa. Mô hình dense đọc các ma trận lớn hơn (22,2 MB mỗi kernel), đạt 86% đỉnh. Tác giả dự đoán tốc độ của mô hình dense trong phạm vi 3,7% và khả năng mở rộng độ sâu ngữ cảnh trong phạm vi 2,4%, xác nhận mô hình của họ. Họ cũng ghi nhận một quy luật tỷ lệ sơ bộ: ngưỡng để đạt 90% băng thông tỷ lệ thuận với độ rộng GPU (tăng 8 lần từ RTX 4060 lên 5090).
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới