Donanım ve ÇıkarımAraştırma 🇷🇺 12.08.2026 12:01

MoE, RTX 5090'da 1,5 Kat Geride Kalıyor ve Bunun Nedeni Yönlendirme Değil

RTX 5090 üzerinde yapılan detaylı bir kıyaslama, bir Uzman Karışımı modelinin (Qwen3.5-35B-A3B) GPU'nun bellek bant genişliğinin yalnızca %41'ini kullandığını, yoğun bir modelin (Qwen3.5-9B) ise %72'sine ulaştığını ortaya koyuyor. Temel neden, uzman yönlendirmesi değil, çekirdek başlatma başına okunan baytların yetersiz olmasıdır. Yazar, başka bir model ve farklı bağlam derinlikleri için yüksek doğrulukla performans öngörüyor.
Yazar, RTX 5090'i llama.cpp b10326 ve Q4_0 niceleme ile kıyaslama yapıyor. MoE modeli Qwen3.5-35B-A3B, bellek bant genişliğinin yalnızca %41'ini kullanarak 317.45 token/sn elde ederken, yoğun Qwen3.5-9B, %72 kullanarak 239.62 token/sn elde ediyor. CUDA grafiklerini, yönlendirmeyi ve GPU'nun yetersiz kullanımını eliyorlar. Bunun yerine, sentetik bir ggml çekirdeği ile bellek bant genişliğinin çekirdek başına okunan baytlarla ölçeklendiğini gösteriyorlar: küçük okumalar (birkaç MB) yalnızca tepe bant genişliğinin %20-50'sini elde ediyor. MoE modelinin birçok uzman projeksiyonu, birçok küçük çekirdeğe (çekirdek başına ortalama 4.6 MB) neden oluyor ve bu da tam bant genişliği eşiğinin altında kalıyor. Yoğun model daha büyük matrisler okuyor (çekirdek başına 22.2 MB) ve tepe değerinin %86'sını elde ediyor. Yazar, yoğun modelin hızını %3.7 içinde ve bağlam derinliği ölçeklemesini %2.4 içinde tahmin ederek modellerini doğruluyor. Ayrıca geçici bir ölçekleme yasasına dikkat çekiyor: %90 bant genişliği eşiği GPU genişliğiyle ölçekleniyor (RTX 4060'tan 5090'a 8 kat).
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler