DGX SparkでのDeepSeek 0731:68トークン/秒へのオーバークロックとカード作者が57を記録した理由
DeepSeek
NVIDIA
vLLM
開発者が、デュアルNVIDIA DGX Spark構成でDeepSeek-V4-Flashをベンチマークし、当初はモデルカードに記載された57トークン/秒に対して42.5トークン/秒を計測しました。vLLMランタイムイメージを切り替え、B12X MoEバックエンドを明示的に有効にしたところ、カード相当のプロファイルで67.6トークン/秒を達成し、その改善は特定の構成変更によるものとしています。
著者は、QSFP 200GとRoCEv2で接続された2つのDGX SparkノードにDeepSeek-V4-Flashをデプロイし、ノード間でテンソル並列処理を使用しました。初期測定では42.5トークン/秒で、モデルカードに記載されている57トークン/秒より約25%低い値でした。いくつかの仮説(温度、プリフィル計算、コンテキスト長)をテストした結果、主な差はランタイムイメージに起因することが判明しました。vLLM 0.21.1ベースのビルドからvLLM 0.25.2を含むビルドに切り替えると、同じチェックポイントで+22%の改善が見られ、検証ステップごとの出力トークン数が3.27から4.80に増加しました。さらなる改善は、--moe-backend flashinfer_b12xを明示的に設定することで得られました。これは、カスタムイメージではB12Xが自動選択から除外されているためであり、カードのようなプロファイルで平均+13.3%(59.7から67.6トークン/秒)の向上をもたらしました。著者はまた、エージェントベンチマークが改善された新しいチェックポイントリリース(0731)に言及し、同様の最適化に関するtonyd2wildによる並行作業を認めています。
出典: Habr — хаб ИИ —
原文
