DeepSeek 0731 on DGX Spark: Hız Aşırtma ile 68 tok/s ve Kart Yazarının Neden 57 Aldığı
DeepSeek
NVIDIA
vLLM
Bir geliştirici, çift NVIDIA DGX Spark kurulumunda DeepSeek-V4-Flash'ı test ederek başlangıçta 42.5 tok/s ölçtü; model kartında belirtilen 57 tok/s'ye kıyasla. vLLM çalışma zamanı görüntüsünü değiştirip B12X MoE arka ucunu açıkça etkinleştirdikten sonra, kart benzeri profilde 67.6 tok/s'ye ulaştı ve iyileştirmeleri belirli yapılandırma değişikliklerine bağladı.
Yazar, QSFP 200G ve RoCEv2 ile bağlanan iki DGX Spark düğümünde DeepSeek-V4-Flash modelini konuşturdu ve düğümler arasında tensör paralelliği kullandı. İlk ölçümler saniyede 42,5 token gösterdi; bu, model kartında belirtilen saniyede 57 token değerinin yaklaşık yüzde 25 altındaydı. Birkaç hipotezi test ettikten sonra (sıcaklık, ön doldurma hesabı, bağlam uzunluğu), temel farkın çalışma zamanı görüntüsünden kaynaklandığı belirlendi: vLLM 0.21.1 tabanlı bir derlemeden vLLM 0.25.2 içeren bir derlemeye geçmek, aynı kontrol noktasında yüzde +22 iyileşme sağladı ve doğrulama adımı başına çıktı token sayısını 3,27'den 4,80'e yükseltti. Daha fazla kazanç, --moe-backend flashinfer_b12x parametresinin açıkça ayarlanmasıyla elde edildi; çünkü özel görüntüde B12X otomatik seçime dahil edilmiyordu; bu da kart benzeri bir profilde ortalama yüzde +13,3 artış sağladı (saniyede 59,7'den 67,6 token). Yazar ayrıca iyileştirilmiş ajan kıyaslamaları içeren yeni bir kontrol noktası sürümünü (0731) duyurdu ve tonyd2wild'ın benzer optimizasyonlar üzerindeki paralel çalışmasını kabul etti.
Kaynak: Habr — хаб ИИ —
orijinal
