Perangkat Keras & Inferensi 🇷🇺 03.08.2026 18:02

DeepSeek 0731 di DGX Spark: Overclocking hingga 68 tok/s dan Mengapa Penulis Kartu Mendapatkan 57

DeepSeekDeepSeek NVIDIANVIDIA vLLMvLLM
Seorang pengembang melakukan benchmarking DeepSeek-V4-Flash pada pengaturan dua unit NVIDIA DGX Spark, awalnya mengukur 42,5 tok/s dibandingkan dengan klaim 57 tok/s pada kartu model. Setelah mengganti image runtime vLLM dan secara eksplisit mengaktifkan backend MoE B12X, mereka mencapai 67,6 tok/s pada profil mirip kartu, mengaitkan peningkatan tersebut pada perubahan konfigurasi spesifik.
Penulis menggunakan DeepSeek-V4-Flash pada dua node DGX Spark yang terhubung melalui QSFP 200G dengan RoCEv2, menggunakan paralelisme tensor antar node. Pengukuran awal menunjukkan 42,5 token per detik, sekitar 25% di bawah klaim 57 token per detik pada kartu model. Setelah menguji beberapa hipotesis (suhu, akuntansi prefill, panjang konteks), perbedaan utama disebabkan oleh image runtime: beralih dari build berbasis vLLM 0.21.1 ke build dengan vLLM 0.25.2 memberikan +22% pada checkpoint yang sama, meningkatkan token keluaran per langkah verifikasi dari 3,27 menjadi 4,80. Peningkatan lebih lanjut diperoleh dengan menetapkan secara eksplisit --moe-backend flashinfer_b12x, karena dalam image kustom B12X dikeluarkan dari pemilihan otomatis; ini menambahkan +13,3% rata-rata pada profil mirip kartu (59,7 menjadi 67,6 token per detik). Penulis juga mencatat rilis checkpoint baru (0731) dengan benchmark agen yang lebih baik, dan mengakui pekerjaan paralel oleh tonyd2wild pada optimasi serupa.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru